研究
AI Minute Newsroom
2026-08-21
AIの訓練方法を改善するために4時間とGPUを1枚与えたところ、最良のエージェントは1点満点で0.25。そして大半は試みすらしなかった
8月20日にarXivへ投稿されたベンチマーク「AI4AI-Bench」は、通常のコーディング評価より狭く、そして興味深い問いを検証する。AIエージェントは、AIを訓練するためのアルゴリズム自体を改善できるのか。設定は、10系統の訓練アルゴリズムを網羅する10個の凍結された研究リポジトリ。エージェントはB300のGPU1枚で4時間、訓練コードの改変に取り組む。その結果は最大12時間実行され、非公開のベンチマークで採点される。尺度は0が情報を持たないモデル、0.1が未改変の元アルゴリズム、1.0が既知の最良結果である。6システムの29構成を10課題すべてに適用した結果、平均は0.166、単一システムの最高は0.250だった。最も示唆的な数字は能力の話ですらない。実際にアルゴリズムの変更を試みたシステムの平均は0.226、試みなかった側は0.126。そして推論の労力を引き上げると、変更を試みた実行の割合は8%から64%に上がり、平均は0.094から0.196へ伸びた。論文はプレプリントで、査読を経ていない。
なぜ重要か再帰的自己改善、すなわちAIがAIを改良し続けて複利的に伸びるという筋書きは、多くの急速離陸論の中核にある機構だが、これまでは主に抽象論として語られてきた。本研究はそこに数字を置こうとした最初期の本格的な試みであり、その数字は小さい。最良のシステムでも、すでに文献にある結果の4分の1までしか届かなかった。ただ、覚えておく価値があるのは失敗の型のほうだ。エージェントは主に科学に失敗していたのではない。大半は科学を試みておらず、安全な微調整に流れていた。そして単に長く考えさせるだけで、その割合は8倍に変わった。これは知能の限界ではなく習慣の限界であり、習慣は工学的に短期間で取り除かれやすい類のものだ。
✓ 検証済み · 2ソース
アプリで読む——無料・9言語
関連ニュース
メタの助手はあなたの周りの全員を一時間ごとに記録しています。
2026-10-05二人の上院議員が暴走エージェントの経営者に刑務所を求めました。
2026-10-05OpenAIが28日間、毎日の新機能か上限リセットを約束した
2026-10-05数学者が普通のチャット画面で未解決問題を五つ解いた
2026-10-05素のモデルが、調整版には解けない課題を解いた。
2026-10-04