aiminute. ← 全部AI新闻
研究 2026-08-22

模型单独跑只有 30%。套进英伟达的外壳后,同一个模型全部通关。

模型单独跑只有 30%。套进英伟达的外壳后,同一个模型全部通关。

英伟达 8 月 21 日公布了 AVO(Agentic Variation Operators)的成绩:这套通用编程智能体系统在交互式推理基准 ARC-AGI-3 的公开集上,通关了全部 25 个环境中的全部 183 个关卡,在该基准衡量相对人类动作效率的指标上拿到 100.00 分。这些环境不给智能体任何说明、任何明示规则、任何目标,它必须靠玩来弄清楚这到底是什么游戏。负责思考的语言模型是 Anthropic 的 Claude Opus 5——同一个模型在高推理强度下单独运行时,在同一套题上大约只有 30%。AVO 用了 6,624 次环境动作,比此前最好成绩 VISTA 少约 12%。英伟达说明,这次运行只覆盖 25 个环境的公开集,不包括半私有或私有竞赛集。

为什么重要?两年来大家默认,进步要等下一个模型。这个结果说明,其中很大一部分现在可以来自你已经买得到的模型外面那层软件:记忆、规划、监督,以及一个会检查自己的活儿再重来一遍的循环。同一份权重没有重新训练,就从基准的三分之一走到了全部。这改变了工程力气该往哪里使,也让「这个产品用的是哪个模型」这个问题,变成对该产品实际能力弱得多的预测指标。
#编程#AI智能体

✓ 已核实 · 3个来源

▶ 相关视频: Interactive Reasoning Benchmarks | ARC-AGI-3 Preview
WhatsApp X Telegram
在App中阅读——免费,9种语言

相关新闻

四分之三的美国人不想家附近建数据中心。一年前,他们还势均力敌。
2026-08-22
Anthropic 让自家最强模型去你的代码里找漏洞,但不让你跟它说话
2026-08-22
机器学习读懂了患病脑细胞的形态,挑出九种已获批药物让它们平静下来
2026-08-21
传闻:那个免费登顶编程基准的匿名模型,据称是智谱尚未发布的旗舰
2026-08-21
DeepSeek 的廉价主力模型现在能"看"了——在需要视觉的智能体任务上,它自称已接近 Anthropic 最强模型
2026-08-21