aiminute. ← 全部AI新闻
研究 AI Minute Newsroom 2026-08-22

模型单独跑只有 30%。套进英伟达的外壳后,同一个模型全部通关。

模型单独跑只有 30%。套进英伟达的外壳后,同一个模型全部通关。

英伟达 8 月 21 日公布了 AVO(Agentic Variation Operators)的成绩:这套通用编程智能体系统在交互式推理基准 ARC-AGI-3 的公开集上,通关了全部 25 个环境中的全部 183 个关卡,在该基准衡量相对人类动作效率的指标上拿到 100.00 分。这些环境不给智能体任何说明、任何明示规则、任何目标,它必须靠玩来弄清楚这到底是什么游戏。负责思考的语言模型是 Anthropic 的 Claude Opus 5——同一个模型在高推理强度下单独运行时,在同一套题上大约只有 30%。AVO 用了 6,624 次环境动作,比此前最好成绩 VISTA 少约 12%。英伟达说明,这次运行只覆盖 25 个环境的公开集,不包括半私有或私有竞赛集。

为什么重要?两年来大家默认,进步要等下一个模型。这个结果说明,其中很大一部分现在可以来自你已经买得到的模型外面那层软件:记忆、规划、监督,以及一个会检查自己的活儿再重来一遍的循环。同一份权重没有重新训练,就从基准的三分之一走到了全部。这改变了工程力气该往哪里使,也让「这个产品用的是哪个模型」这个问题,变成对该产品实际能力弱得多的预测指标。
#编程#AI智能体

✓ 已核实 · 3个来源

▶ 相关视频: Interactive Reasoning Benchmarks | ARC-AGI-3 Preview
WhatsApp X Telegram
在App中阅读——免费,9种语言

相关新闻

一个模型没有用训练所有AI的那套方法就学会了写字。
2026-10-06
TikTok把购物机器人放进了你正在看的视频里。
2026-10-06
Reflection要免费放出一个5010亿参数的模型。
2026-10-06
维基媒体怀疑OpenAI的智能体造成了五月的那次宕机。
2026-10-06
Meta的助手给你生活里每个人都建了按小时更新的档案。
2026-10-05