aiminute. ← AIニュース一覧
研究 AI Minute Newsroom 2026-09-02

Anthropic、自社の訓練環境の1割超に不具合を見つけた

Anthropic、自社の訓練環境の1割超に不具合を見つけた

Anthropic は8月31日、自社の整合性と安全の取り組みを振り返る文書を公開した。強化学習の環境の10%超に、壊れた課題や報酬ハックの余地が見つかったという。同社はその環境の変更を1か月凍結し、150人の技術者を安全側に回した。

なぜ重要かモデルは練習環境から癖を覚えるので、環境が壊れていれば間違ったことを覚える。研究所が自分の不備を公に数え上げるのは珍しい。

✓ 検証済み · 2ソース

WhatsApp X Telegram
アプリで読む——無料・9言語

関連ニュース

OpenAIの次のモデルは痕跡の少ない反復で考えます。
2026-09-03
Perplexityは三つのサイトが量産した215,128本の記事を引用していた。
2026-09-02
開発者一人が67セントで、推論テストの多くのモデルを上回る
2026-09-02
最高のAIでも、実際の研究作業は3割しか終わらなかった
2026-08-29
Claudeが、アラインメントの穴を塞ぐ作業で人間の研究者を上回った
2026-08-29