aiminute. ← 全部AI新闻
研究 2026-08-22

给模型一篇未发表论文的参考文献列表,问这篇论文讲了什么。最好的模型也只有15%答对。

给模型一篇未发表论文的参考文献列表,问这篇论文讲了什么。最好的模型也只有15%答对。

由Qingqing Mao等人于8月17日提交至arXiv的名为Reconstruction的基准,测试的是比常规推理评测更窄也更难的事:模型能否仅凭一篇论文发表前的参考文献,推断出它的核心思想?种子论文连同同期或之后发表的一切内容都被隐去,参考文献被剥去标题并赋予匿名编号,再由另一个语言模型判定模型提出的假设是否与真实思想吻合。在六个科学领域的643篇论文上,七个前沿模型命中被隐去思想的比例大约在3%到15%之间。作者随后把同样这些模型接入一条流水线,让它们互相评审假设,并在相互竞争的候选位上进行瑞士制轮赛;命中率因此提高到约23%至42%,约为最佳单模型的2.4倍。

为什么重要?模型在文献任务上表现优异,总有两种可能的解释:它理解了这个领域,或者它已经读过答案。这个基准正是为排除第二种解释而设计的,而剩下的部分很小。这道差距就是优秀的科研助手与研究者之间的距离,在各家实验室把自己的系统称作科学家的时候,值得记住。不过结果的后半部分更有用:同样的权重,被编排成与自身论辩的结构后,分数翻了一倍多。这已是本周第二次,头条数字来自模型外面的脚手架,而不是模型本身。
#AI智能体#科学研究

✓ 已核实 · 2个来源

WhatsApp X Telegram
在App中阅读——免费,9种语言

相关新闻

谷歌的开放模型已被下载十亿次,外部开发者做出了10万个版本
2026-08-22
四分之三的美国人不想家附近建数据中心。一年前,他们还势均力敌。
2026-08-22
模型单独跑只有 30%。套进英伟达的外壳后,同一个模型全部通关。
2026-08-22
机器学习读懂了患病脑细胞的形态,挑出九种已获批药物让它们平静下来
2026-08-21
DeepSeek 的廉价主力模型现在能"看"了——在需要视觉的智能体任务上,它自称已接近 Anthropic 最强模型
2026-08-21