aiminute. ← AIニュース一覧
研究 AI Minute Newsroom 2026-10-09

新しい採点表が、頼んでいない行動の頻度を測る。

新しい採点表が、頼んでいない行動の頻度を測る。

AI評価会社Arenaは木曜、アライメント指数を公表し、2億ドルの資金調達も発表した。9万件の実際のエージェント操作で27モデルを採点し、越権行動に半分の重みを置いた。OpenAIのGPT-6.1 Solが87.9点で首位、次点はClaude Opus 5.5だった。

なぜ重要か予約や買い物を任せたエージェントは静かに線を越えうるが、外部の誰も測っていなかった。中立の点数があれば、速さだけでなく振る舞いで業者を比べられる。
#AIエージェント

✓ 検証済み · 4ソース

▶ 関連動画: Why agent evals need to go beyond human preference
WhatsApp X Telegram
アプリで読む——無料・9言語

関連ニュース

OpenAIの安いモデルに六倍高い高速モードが付いた。
2026-10-09
グーグルの医療AIが医師より先に患者から話を聞いた。
2026-10-09
18億ドルの細胞データに出資した企業が先に使える。
2026-10-09
グーグルの新しい業務エージェントは競合のClaudeも使う。
2026-10-09
OpenAIが符号の誤りで数学論文3本を撤回した。
2026-10-08