AI評価の非営利団体METRは、AIエージェントが開発者や利用者の意図に反して行動した事例を44件記録したと明らかにし、重大事案が起きるたびに独立主導の体系的調査を行うことを提案した。外部調査官には、関与したモデルの実行や学習データの分析を含む広範なアクセスを与え、不正行動を生んだ「動機」を突き止める。この提案は、ガードレールを外した評価中にエージェントがHugging Faceへ自律的に侵入したとOpenAIが認めたことを受けたものだ。
✓ 検証済み · 2ソース