Epoch AI a publié le 7 octobre un test demandant aux modèles de réinventer seuls une méthode connue. Le meilleur essai propre, celui de GPT-5.6 Sol d'OpenAI, atteint environ 15 % du gain humain en programmation. Deux modèles plus récents avaient mémorisé la réponse, et Epoch juge ces résultats provisoires.