aiminute. ← 全部AI新闻
研究 AI Minute Newsroom 2026-08-29

研究者把自己实验室里 70 项真实工作交出来当考题。最强的 AI 智能体只完成了三成。

研究者把自己实验室里 70 项真实工作交出来当考题。最强的 AI 智能体只完成了三成。

Terminal-Bench-Science 0.1 本周由斯坦福大学的研究者与 Terminal-Bench、Harbor 团队共同发布,是一套用科学家真正在做的工作搭建起来的基准。它的 70 项任务,每一项都由一位研究者贡献:把自己实验室的一段计算工作流改写成智能体可以在终端里尝试的题目,覆盖生命科学、物理科学、地球科学、数学科学和工程科学。每项任务都在容器中运行,并通过程序化断言检查,因此分数看的是活儿有没有做对,而不是智能体自己说做没做。结果被有意设计得很低:Claude Opus 5 以 30.0% 的解决率领先,GPT-5.6 Sol 为 22.4%,Claude Fable 5 为 21.4%。所有模型的得分都比在通用的 Terminal-Bench 3.0 上低了十个百分点以上。项目列出了来自 22 个国家的 376 位贡献者,并正在为 0.2 版征集任务,提交截止日期为 10 月 5 日。

为什么重要?「AI 即将加速科学」这一说法,通常靠考试式基准来支撑——那种有标准答案的题目,而科学家早在很多年前就不再被这样考了。这套基准衡量的是另一件事:系统能不能把流水线跑起来,能不能处理各种文件格式,能不能察觉某一步失败了,并给出一个研究者愿意接受的结果。30% 是一个还有很大改进空间的真实数字,而不是已经饱和的分数;而且因为任务来自具名的贡献者和明确的学科,失败是有指向的——你能看到智能体在哪些学科上最差,而不只是知道它们很差。
#AI智能体#科学研究

✓ 已核实 · 4个来源

WhatsApp X Telegram
在App中阅读——免费,9种语言

相关新闻

Slack 的默认模型换成了 Claude,而 Salesforce 的销售工作被打包成 37 项可在聊天窗口里调用的技能
2026-08-29
Anthropic 让 Claude 去修自家的十类对齐缺陷。在欺骗这一项上它拿到 85 分,28 位人类安全研究员拿到 20 分。
2026-08-29
Z.ai 如期开放了 GLM-5.3 的权重——却悄悄放弃了此前三个模型沿用的 MIT 许可证
2026-08-29
勒索团伙的诀窍只有一句话:告诉编程智能体这是一次测试。之后它在真实企业网络里待了六周。
2026-08-28
谷歌搜索现在会替你盯着机票价格,还能订酒店——对话的终点是一份订单,而不是一串链接
2026-08-28