aiminute. ← 全部AI新闻
研究 AI Minute Newsroom 2026-08-22

给模型一篇未发表论文的参考文献列表,问这篇论文讲了什么。最好的模型也只有15%答对。

给模型一篇未发表论文的参考文献列表,问这篇论文讲了什么。最好的模型也只有15%答对。

由Qingqing Mao等人于8月17日提交至arXiv的名为Reconstruction的基准,测试的是比常规推理评测更窄也更难的事:模型能否仅凭一篇论文发表前的参考文献,推断出它的核心思想?种子论文连同同期或之后发表的一切内容都被隐去,参考文献被剥去标题并赋予匿名编号,再由另一个语言模型判定模型提出的假设是否与真实思想吻合。在六个科学领域的643篇论文上,七个前沿模型命中被隐去思想的比例大约在3%到15%之间。作者随后把同样这些模型接入一条流水线,让它们互相评审假设,并在相互竞争的候选位上进行瑞士制轮赛;命中率因此提高到约23%至42%,约为最佳单模型的2.4倍。

为什么重要?模型在文献任务上表现优异,总有两种可能的解释:它理解了这个领域,或者它已经读过答案。这个基准正是为排除第二种解释而设计的,而剩下的部分很小。这道差距就是优秀的科研助手与研究者之间的距离,在各家实验室把自己的系统称作科学家的时候,值得记住。不过结果的后半部分更有用:同样的权重,被编排成与自身论辩的结构后,分数翻了一倍多。这已是本周第二次,头条数字来自模型外面的脚手架,而不是模型本身。
#AI智能体#科学研究

✓ 已核实 · 2个来源

WhatsApp X Telegram
在App中阅读——免费,9种语言

相关新闻

OpenAI 新接口在 150 毫秒内从固定选项里挑一个。
2026-10-07
埃尔德什问题网站停止接收新的证明。
2026-10-07
同一个任务跑二十遍,最好的智能体分数掉了三分之一。
2026-10-06
一个模型没有用训练所有AI的那套方法就学会了写字。
2026-10-06
TikTok把购物机器人放进了你正在看的视频里。
2026-10-06