蒂莫西·高尔斯今天发表了一篇长文,说明大语言模型在哪些数学任务上表现良好、在哪些上不行。他列出的优势很具体:为猜想寻找例子与反例、套用文献中已有的标准论证,以及凭纯粹的速度去搜索人类懒得去看的地方。他指出的欠缺,用他自己的话说是「嗅觉」——那种能在投入数周之前,就告诉数学家某条进攻路线走不通的感觉。他认为,模型会一头扎进死胡同,而且常常把一个问题化简成更窄的子问题,却并没有取得真正的进展。文章依据的是他本人与 GPT-5.6 Pro 的往来对话,而不是正式的基准测试。
为什么重要?这篇文章落在 AI 与数学这喧闹的两周正中间,而且是其中最有用的一份表述,因为它既不是新闻稿,也不是一味贬低。高尔斯描述的不是记分牌,而是分工:机器负责覆盖地面,人类决定哪片地面值得覆盖。它也解释了为什么「问题被解决了」的公告不断招来数学家的异议。搜索找到的是那些本就几乎触手可及的结果,这确实是真实贡献——但当人们说一个问题很难时,指的并不是这一部分工作。