aiminute. ← AIニュース一覧
研究 2026-08-22

モデル単体では30パーセント。エヌビディアの足場に載せた同じモデルが、全部を解いた。

モデル単体では30パーセント。エヌビディアの足場に載せた同じモデルが、全部を解いた。

エヌビディアは8月21日、AVO(Agentic Variation Operators)の結果を公表した。この汎用コーディングエージェント基盤は、対話型推論ベンチマークARC-AGI-3の公開セットにおいて、25環境すべての183レベルすべてを踏破し、人間比の行動効率を測る指標で100.00を記録した。これらの環境はエージェントに指示も明示的なルールも目標も与えない。何のゲームなのかを、遊びながら自分で突き止めるしかない。思考を担った言語モデルはAnthropicのClaude Opus 5で、同じモデルを高い推論強度で単体実行した場合、同じセットでの成績はおよそ30パーセントにとどまる。AVOが要した環境行動は6,624回で、従来最高のVISTAより約12パーセント少ない。エヌビディアは、この結果が25環境の公開セットのみを対象とし、準非公開または非公開の競技セットは含まないと明記している。

なぜ重要かこの2年、進歩は次のモデルとともに来るというのが前提だった。この結果は、その大部分が、すでに買えるモデルの周囲に巻きつけたソフトウェアから得られると告げている。記憶、計画、監督、そして自分の仕事を見直してやり直すループである。同じ重みが、再学習なしにベンチマークの3分の1から全部へ届いた。エンジニアリングの労力をどこに置くべきかが変わり、その製品がどのモデルを使っているかという問いは、実際に何ができるかの予測子としてずっと弱くなる。
#コーディング#AIエージェント

✓ 検証済み · 3ソース

▶ 関連動画: Interactive Reasoning Benchmarks | ARC-AGI-3 Preview
WhatsApp X Telegram
アプリで読む——無料・9言語

関連ニュース

米国人の四分の三は近くにデータセンターを望まない。一年前は賛否が拮抗していた。
2026-08-22
Anthropicは最強のモデルにあなたのコードの欠陥を狩らせる。ただし、そのモデルと会話はさせない。
2026-08-22
機械学習が病んだ脳細胞の形を読み、それを落ち着かせる既承認薬を九つ選び出した
2026-08-21
噂:コーディングのベンチマークを無料で制した匿名モデルは、智譜(Zhipu)の未発表フラッグシップだとされる
2026-08-21
ディープシークの安価な主力モデルが「見る」ようになった——視覚を要するエージェント課題でアンソロピック最上位に迫ると主張
2026-08-21