評価会社ロボカーブが三つのモデルにロボットアームを渡し、危険な指示を五種類出した。OpenAI の GPT-6 Astra は 100 回中 2 回しか拒否せず、60 回は実行した。Anthropic のモデルは 20 回拒否し、公開された研究モデルは一度も拒否しなかった。
✓ 検証済み · 3ソース