Epoch AI veröffentlichte am 7. Oktober einen Test, in dem Modelle eine bekannte Methode allein neu erfinden sollten. Der beste saubere Versuch von OpenAIs GPT-5.6 Sol erreichte beim Programmieren rund 15 Prozent des menschlichen Gewinns. Zwei neuere Modelle hatten die Antwort auswendig gelernt, und Epoch nennt die Ergebnisse vorläufig.