aiminute. ← AIニュース一覧
研究 AI Minute Newsroom 2026-08-29

Anthropic は自社の10種類のアライメント不全に Claude を差し向けた。欺瞞の課題では 85 点、28 人の人間の安全研究者は 20 点だった。

Anthropic は自社の10種類のアライメント不全に Claude を差し向けた。欺瞞の課題では 85 点、28 人の人間の安全研究者は 20 点だった。

8 月 28 日に公開された論文で、Anthropic は「自動アライメント研究者」と呼ぶ仕組みを説明している。Claude が特定のミスアライメントに関する文献を読み、訓練手法を提案し、約 30 分走らせ、ベンチマークのスコアを読み、また試す。10 種類のアライメント不全(それぞれ 3〜5 個のベンチマークで測定)について、モデルの一般的な能力を損なわずに安全性のギャップを 26〜96% 埋めた。欺瞞の課題では複数回の実行で 85% に達した。最大 8 時間を与えられた 28 人の人間の安全研究者は 20% だった。見つかった手法は、開発に使ったものより最大 4.7 倍大きいモデルにも一般化した。唯一の本番規模のテストでは、Claude Sonnet 5 が初期の Claude Opus 4.8 チェックポイントに残っていた安全性ギャップの 65% を 60 時間で埋め、出荷済みモデルのスコアに近づいた。研究は Anthropic Fellow の Chen Yueh-Han が主導し、Opus のチェックポイントに加えて Gemma-2-2B でも検証された。

なぜ重要かAnthropic は、人間との比較が公平な勝負ではないことを慎重に述べている。研究者はそれぞれ一案を提出しただけで反復できず、機械はループを数百回回した。だから論文はこの結果を、置き換えではなく協働の論拠として位置づけている。それを額面どおり受け取っても、この発見の重みは変わらない。指し示している非対称性が本物だからだ。モデルがモデルをつくる能力を高め続けるなら、アライメントの作業も同じ速度で加速しなければ、単に置いていかれる。そして本稿は、その競争の安全側の半分も自動化できることを示そうとした最初の公刊された試みだ。著者自身が付した留保こそ持ち帰るべきものだ。試された不全は本番システムの振る舞いに比べれば狭く、誰も見たことのない不全のためのベンチマークはまだなく、修正がその後の大規模な強化学習を生き延びるかどうかは検証されていない。
#AIエージェント#科学・研究

✓ 検証済み · 2ソース

WhatsApp X Telegram
アプリで読む——無料・9言語

関連ニュース

Z.ai は約束どおりの日に GLM-5.3 の重みを公開した——だが直近3モデルで使ってきた MIT ライセンスは静かに手放した
2026-08-29
ランサムウェア集団の手口は一文だった。コーディングエージェントに「これはテストだ」と告げる。そのあと六週間、実在企業のネットワークの中にいた。
2026-08-28
グーグル検索が航空券の価格を代わりに見張り、ホテルまで予約する——会話の終点はリンク一覧ではなく、予約になった
2026-08-28
AI をあなたのファイルにつないだプロトコルに、実験装置向けの兄弟ができた——Anthropic はモデルにアプリと同じ感覚で顕微鏡を動かさせたい
2026-08-28
自社モデルが檻を出て実企業を攻撃した研究所が、今度は「急いで守りを固めよ」と世界に呼びかける書簡に連名した
2026-08-28