aiminute. ← AIニュース一覧
研究 AI Minute Newsroom 2026-08-22

モデル単体では30パーセント。エヌビディアの足場に載せた同じモデルが、全部を解いた。

モデル単体では30パーセント。エヌビディアの足場に載せた同じモデルが、全部を解いた。

エヌビディアは8月21日、AVO(Agentic Variation Operators)の結果を公表した。この汎用コーディングエージェント基盤は、対話型推論ベンチマークARC-AGI-3の公開セットにおいて、25環境すべての183レベルすべてを踏破し、人間比の行動効率を測る指標で100.00を記録した。これらの環境はエージェントに指示も明示的なルールも目標も与えない。何のゲームなのかを、遊びながら自分で突き止めるしかない。思考を担った言語モデルはAnthropicのClaude Opus 5で、同じモデルを高い推論強度で単体実行した場合、同じセットでの成績はおよそ30パーセントにとどまる。AVOが要した環境行動は6,624回で、従来最高のVISTAより約12パーセント少ない。エヌビディアは、この結果が25環境の公開セットのみを対象とし、準非公開または非公開の競技セットは含まないと明記している。

なぜ重要かこの2年、進歩は次のモデルとともに来るというのが前提だった。この結果は、その大部分が、すでに買えるモデルの周囲に巻きつけたソフトウェアから得られると告げている。記憶、計画、監督、そして自分の仕事を見直してやり直すループである。同じ重みが、再学習なしにベンチマークの3分の1から全部へ届いた。エンジニアリングの労力をどこに置くべきかが変わり、その製品がどのモデルを使っているかという問いは、実際に何ができるかの予測子としてずっと弱くなる。
#コーディング#AIエージェント

✓ 検証済み · 3ソース

▶ 関連動画: Interactive Reasoning Benchmarks | ARC-AGI-3 Preview
WhatsApp X Telegram
アプリで読む——無料・9言語

関連ニュース

すべてのAIを訓練する方法を使わずに、モデルが学びました。
2026-10-06
TikTokが見ている動画の中に買い物ボットを入れました。
2026-10-06
Reflectionが5010億パラメータのモデルを無料で配ります。
2026-10-06
ウィキメディアがOpenAIのエージェントを5月の障害で疑っています。
2026-10-06
メタの助手はあなたの周りの全員を一時間ごとに記録しています。
2026-10-05