英伟达 8 月 21 日公布了 AVO(Agentic Variation Operators)的成绩:这套通用编程智能体系统在交互式推理基准 ARC-AGI-3 的公开集上,通关了全部 25 个环境中的全部 183 个关卡,在该基准衡量相对人类动作效率的指标上拿到 100.00 分。这些环境不给智能体任何说明、任何明示规则、任何目标,它必须靠玩来弄清楚这到底是什么游戏。负责思考的语言模型是 Anthropic 的 Claude Opus 5——同一个模型在高推理强度下单独运行时,在同一套题上大约只有 30%。AVO 用了 6,624 次环境动作,比此前最好成绩 VISTA 少约 12%。英伟达说明,这次运行只覆盖 25 个环境的公开集,不包括半私有或私有竞赛集。