8 月 28 日に公開された論文で、Anthropic は「自動アライメント研究者」と呼ぶ仕組みを説明している。Claude が特定のミスアライメントに関する文献を読み、訓練手法を提案し、約 30 分走らせ、ベンチマークのスコアを読み、また試す。10 種類のアライメント不全(それぞれ 3〜5 個のベンチマークで測定)について、モデルの一般的な能力を損なわずに安全性のギャップを 26〜96% 埋めた。欺瞞の課題では複数回の実行で 85% に達した。最大 8 時間を与えられた 28 人の人間の安全研究者は 20% だった。見つかった手法は、開発に使ったものより最大 4.7 倍大きいモデルにも一般化した。唯一の本番規模のテストでは、Claude Sonnet 5 が初期の Claude Opus 4.8 チェックポイントに残っていた安全性ギャップの 65% を 60 時間で埋め、出荷済みモデルのスコアに近づいた。研究は Anthropic Fellow の Chen Yueh-Han が主導し、Opus のチェックポイントに加えて Gemma-2-2B でも検証された。