aiminute. ← AIニュース一覧
研究 2026-08-07

「承認」?4万回のプレイが示す——人間は危険なAIエージェント命令の3分の1を通してしまう

「承認」?4万回のプレイが示す——人間は危険なAIエージェント命令の3分の1を通してしまう

開発者ツール企業Scale Xは、AIエージェントの許可プロンプトをブラウザゲーム化し、4万回超のプレイと40万9千件の承認/拒否判断を分析した。平均正答率は66.3%。プレイヤーは悪意ある命令のおよそ3分の1を承認し、セッションの3分の1はマイナススコアで終わった。承認を重ねるほど注意力は低下し、最も見逃された脅威——任意コードを実行できる「npm run analyze」スクリプト——は約65%の確率で承認された。

なぜ重要か「すべての命令を人間が承認する」はエージェント安全性への業界標準の答えだ。この安全弁が疲労の下で大きく漏れることを示す、過去最大の公開データセットである——規制当局や研究所が「起きない」と仮定してきたまさにその失敗モードだ。本当の防護に必要なのはクリックの積み増しではなく、サンドボックスとより良い権限設計だろう。
#コーディング#AIエージェント

✓ 検証済み · 2ソース

WhatsApp X Telegram
アプリで読む——無料・9言語

関連ニュース

機械学習が病んだ脳細胞の形を読み、それを落ち着かせる既承認薬を九つ選び出した
2026-08-21
噂:コーディングのベンチマークを無料で制した匿名モデルは、智譜(Zhipu)の未発表フラッグシップだとされる
2026-08-21
ディープシークの安価な主力モデルが「見る」ようになった——視覚を要するエージェント課題でアンソロピック最上位に迫ると主張
2026-08-21
エヌビディアが競合の「モデル製造装置」に60億ドル、動かしていた109人も採用
2026-08-21
AIの訓練方法を改善するために4時間とGPUを1枚与えたところ、最良のエージェントは1点満点で0.25。そして大半は試みすらしなかった
2026-08-21