Epoch AI publicó el 7 de octubre una prueba que pedía a los modelos reinventar solos un método conocido. El mejor intento limpio, de GPT-5.6 Sol de OpenAI, logró cerca del 15% de la mejora humana en programación. Dos modelos más nuevos habían memorizado la respuesta, y Epoch considera provisionales los resultados.