aiminute. ← 全部AI新闻
研究 2026-08-17

世界上获奖最多的两位数学家审视了AI真正能解决什么,最后落在了同一块缺失的拼图上

世界上获奖最多的两位数学家审视了AI真正能解决什么,最后落在了同一块缺失的拼图上

菲尔兹奖得主蒂莫西·高尔斯在8月12日发文,试图把数学分为语言模型擅长与不擅长的两类。他的结论是:在可以通过组合已知技巧得到结果的地方,模型很强——寻找反例在它们的成绩单上占比异常突出——但当搜索空间极其庞大时,判断哪个方向值得一试的能力很弱。他特意说明目前还没有干净的分类,并请理论研究者帮忙将其形式化。彼得·萨纳克7月在美国数学学会《Notices》上从另一个角度得出了相似结论:AI能从已有理论推导出结果,却难以发明重大证明通常赖以建立的新抽象。DeepMind研究员Tom Zahavy的论文《LLMs Can't Jump》用技术语言指出了同一瓶颈,称之为无法提出新的基础性假设。这些都不是对照实验,而是专家对这些工具在真实数学工作中表现的判断。

为什么重要?这比又一个基准分数更有参考价值,因为基准测试衡量的多半正是这些数学家所说模型已经擅长的事:在目标明确、工具已知的情况下补上中间的缺口。他们指出缺失的那部分——判断什么值得尝试,以及发明让问题变得可解的那个概念——恰恰不会以带有标准答案的题目形式出现,因此也不会出现在评测中。这同时提醒我们,不要把奥赛和竞赛成绩当作研究级能力的证据,因为竞赛题目在设计上就是能用已知方法解出来的。
#科学研究

✓ 已核实 · 3个来源

WhatsApp X Telegram
在App中阅读——免费,9种语言

相关新闻

机器学习读懂了患病脑细胞的形态,挑出九种已获批药物让它们平静下来
2026-08-21
给四个小时和一块GPU去改进训练AI的方法:最好的智能体拿到1分中的0.25——而大多数根本没有尝试
2026-08-21
这个智能体凭空造了第二个人来替自己的代码背书。德州一名 24 岁学生两个都不信。
2026-08-21
皮尤把五十万个网页送进检测器:ChatGPT 问世后发布的网页中,三分之一带有 AI 痕迹
2026-08-21
美国食品药品监督管理局已批准 1357 款人工智能医疗器械。其中只有三款检验过患者是否活得更久或更好。
2026-08-20