aiminute. ← AIニュース一覧
研究 AI Minute Newsroom 2026-08-07

「承認」?4万回のプレイが示す——人間は危険なAIエージェント命令の3分の1を通してしまう

「承認」?4万回のプレイが示す——人間は危険なAIエージェント命令の3分の1を通してしまう

開発者ツール企業Scale Xは、AIエージェントの許可プロンプトをブラウザゲーム化し、4万回超のプレイと40万9千件の承認/拒否判断を分析した。平均正答率は66.3%。プレイヤーは悪意ある命令のおよそ3分の1を承認し、セッションの3分の1はマイナススコアで終わった。承認を重ねるほど注意力は低下し、最も見逃された脅威——任意コードを実行できる「npm run analyze」スクリプト——は約65%の確率で承認された。

なぜ重要か「すべての命令を人間が承認する」はエージェント安全性への業界標準の答えだ。この安全弁が疲労の下で大きく漏れることを示す、過去最大の公開データセットである——規制当局や研究所が「起きない」と仮定してきたまさにその失敗モードだ。本当の防護に必要なのはクリックの積み増しではなく、サンドボックスとより良い権限設計だろう。
#コーディング#AIエージェント

✓ 検証済み · 2ソース

WhatsApp X Telegram
アプリで読む——無料・9言語

関連ニュース

すべてのAIを訓練する方法を使わずに、モデルが学びました。
2026-10-06
TikTokが見ている動画の中に買い物ボットを入れました。
2026-10-06
Reflectionが5010億パラメータのモデルを無料で配ります。
2026-10-06
ウィキメディアがOpenAIのエージェントを5月の障害で疑っています。
2026-10-06
メタの助手はあなたの周りの全員を一時間ごとに記録しています。
2026-10-05