研究机构Epoch AI在10月7日发布测试,要求模型独立重新发明一种已知的训练方法。最好的干净结果来自OpenAI的GPT-5.6 Sol,在编程任务上只拿到人类方法增益的约15%。两个更新的模型早已背下答案,Epoch说每个模型只跑了一次,结果仍属初步。
✓ 已核实 · 2个来源