菲尔兹奖得主蒂莫西·高尔斯在8月12日发文,试图把数学分为语言模型擅长与不擅长的两类。他的结论是:在可以通过组合已知技巧得到结果的地方,模型很强——寻找反例在它们的成绩单上占比异常突出——但当搜索空间极其庞大时,判断哪个方向值得一试的能力很弱。他特意说明目前还没有干净的分类,并请理论研究者帮忙将其形式化。彼得·萨纳克7月在美国数学学会《Notices》上从另一个角度得出了相似结论:AI能从已有理论推导出结果,却难以发明重大证明通常赖以建立的新抽象。DeepMind研究员Tom Zahavy的论文《LLMs Can't Jump》用技术语言指出了同一瓶颈,称之为无法提出新的基础性假设。这些都不是对照实验,而是专家对这些工具在真实数学工作中表现的判断。