Terminal-Bench-Science 0.1 本周由斯坦福大学的研究者与 Terminal-Bench、Harbor 团队共同发布,是一套用科学家真正在做的工作搭建起来的基准。它的 70 项任务,每一项都由一位研究者贡献:把自己实验室的一段计算工作流改写成智能体可以在终端里尝试的题目,覆盖生命科学、物理科学、地球科学、数学科学和工程科学。每项任务都在容器中运行,并通过程序化断言检查,因此分数看的是活儿有没有做对,而不是智能体自己说做没做。结果被有意设计得很低:Claude Opus 5 以 30.0% 的解决率领先,GPT-5.6 Sol 为 22.4%,Claude Fable 5 为 21.4%。所有模型的得分都比在通用的 Terminal-Bench 3.0 上低了十个百分点以上。项目列出了来自 22 个国家的 376 位贡献者,并正在为 0.2 版征集任务,提交截止日期为 10 月 5 日。