aiminute. ← 全部AI新闻
研究 AI Minute Newsroom 2026-08-23

一个270亿参数的模型在复现已发表论文上胜过了Opus 4.8和GPT-5.5

一个270亿参数的模型在复现已发表论文上胜过了Opus 4.8和GPT-5.5

由谷歌DeepMind前员工创办、约十来人的伦敦实验室Inherent于8月22日表示,其智能体Faraday对已发表科学结论的复现比Anthropic的Claude Opus 4.8和OpenAI的GPT-5.5更为忠实。Faraday运行在开放的270亿参数模型Qwen 3.6之上,采用长时程强化学习训练。测试基准是Inherent自建的Replica:取自自然语言处理、材料科学和天气预报领域100篇论文的310项任务。每项任务要求智能体在从未看过原图的情况下,在有限时间和算力内复现一张图表。Inherent称其在所有类别中均领先,在元学习、结构生物学和材料科学上优势最明显。该实验室于2026年5月带着5000万美元种子轮融资走出隐身状态,尚未展示真正的新发现。

为什么重要?先说两点保留:这套基准是公司自己的,而且复现不等于发现。仍然值得注意的是规模。一个训练得当的270亿开放模型,在一项需要韧劲而非记忆的任务上击败了可能大上百倍的系统——读一篇论文,猜出作者略去的步骤,然后一遍遍磨到图表复现出来。这样的工作量,一所大学的实验室是负担得起的。
#AI智能体#科学研究

✓ 已核实 · 3个来源

WhatsApp X Telegram
在App中阅读——免费,9种语言

相关新闻

阿里巴巴用一整架100部真实手机训练模型——如今在真机上100个任务能完成92个
2026-08-23
OpenAI 把 Codex 底下的引擎白送了出去——而它自己的数据说,引擎比模型更值钱
2026-08-22
给模型一篇未发表论文的参考文献列表,问这篇论文讲了什么。最好的模型也只有15%答对。
2026-08-22
谷歌的开放模型已被下载十亿次,外部开发者做出了10万个版本
2026-08-22
四分之三的美国人不想家附近建数据中心。一年前,他们还势均力敌。
2026-08-22