aiminute. ← Tüm AI haberleri
Araştırma AI Minute Newsroom 2026-09-02

Anthropic kendi eğitim ortamlarının %10'undan fazlasını bozuk buldu.

Anthropic kendi eğitim ortamlarının %10'undan fazlasını bozuk buldu.

Anthropic 31 Ağustos'ta hizalama ve güvenlik çalışmasının dökümünü yayımladı. Pekiştirmeli öğrenme ortamlarının yüzde 10'undan fazlasında bozukluk veya ödül kandırma buldu. Şirket bu ortamlardaki değişiklikleri bir ay dondurdu ve 150 mühendisi güvenliğe kaydırdı.

Bu neden önemli?Modeller alışkanlıklarını bu alıştırma ortamlarından öğrenir, bozuk ortam yanlış şeyi öğretir. Bir laboratuvarın kendi hatalarını açıkça sayması az görülür.

✓ Doğrulandı · 2 kaynak

WhatsApp X Telegram
Uygulamada oku — ücretsiz, 9 dilde

İlgili haberler

OpenAI'ın yeni modeli iz bırakmayan döngülerle düşünüyor.
2026-09-03
Perplexity üç sitenin ürettiği 215.128 rehberi kaynak gösteriyor.
2026-09-02
Bir geliştirici 67 sentle akıl yürütme testinde birçok modeli geçti.
2026-09-02
En iyi yapay zekâ ajanı gerçek laboratuvar işinin %30'unu bitirdi
2026-08-29
Claude, hizalanma açıklarını kapatmada insan araştırmacıları geçti
2026-08-29