Araştırma
AI Minute Newsroom
2026-08-29
Anthropic, Claude'u kendi hizalanma hatalarının onunun üzerine saldı. Aldatma görevinde 85 aldı; 28 insan güvenlik araştırmacısı 20 almıştı.
28 Ağustos'ta yayımlanan makalede Anthropic, 'otomatik hizalanma araştırmacısı' dediği şeyi anlatıyor: Claude belirli bir hizalanma bozukluğuna dair literatürü okuyor, bir eğitim yöntemi öneriyor, bunu yaklaşık otuz dakika çalıştırıyor, ölçüt puanını okuyor ve yeniden deniyor. Her biri üç ila beş ölçütle ölçülen on hizalanma hatası kategorisinde, modelin genel yeteneklerini bozmadan güvenlik açığının yüzde 26 ila 96'sını kapattı. Aldatma görevinde birden çok koşuda yüzde 85'e ulaştı; her birine sekiz saate kadar süre verilen 28 insan güvenlik araştırmacısı yüzde 20'de kaldı. Bulduğu yöntemler, geliştirildikleri modellerden 4,7 kata kadar büyük modellere genelleşti. Tek üretim ölçekli testte Claude Sonnet 5, erken bir Claude Opus 4.8 kontrol noktasındaki kalan güvenlik açığının yüzde 65'ini 60 saatte kapattı ve yayındaki modellerin puanlarına yaklaştı. Çalışmayı bir Anthropic Fellow'u olan Chen Yueh-Han yürüttü; testler Opus kontrol noktasının yanı sıra Gemma-2-2B üzerinde de yapıldı.
Bu neden önemli?Anthropic, insan karşılaştırmasının adil bir dövüş olmadığını özenle söylüyor: araştırmacılar birer fikir gönderdi ve üzerine yineleme yapamadı, makine ise döngüyü yüzlerce kez çalıştırdı; bu yüzden makale sonucu yerine geçme değil, birlikte çalışma savı olarak sunuyor. Bunu olduğu gibi kabul etsek bile bulgu önemini koruyor, çünkü işaret ettiği asimetri gerçek. Modeller model yapmakta daha iyi hâle gelmeyi sürdürürse, hizalanma çalışması aynı hızda hızlanmak zorunda; yoksa geride kalır. Bu da yarışın güvenlik yarısının da otomatikleştirilebileceğini göstermeye dönük ilk yayımlanmış girişim. Yazarların koyduğu çekinceler akılda tutulmaya değer: test edilen hatalar, üretimdeki sistemlerin yaptıklarına kıyasla dar kapsamlı; kimsenin henüz görmediği hatalar için ölçüt yok; ve düzeltmelerin sonrasında gelen ağır pekiştirmeli öğrenmeden sağ çıkıp çıkmadığı denenmedi.
✓ Doğrulandı · 2 kaynak
Uygulamada oku — ücretsiz, 9 dilde
İlgili haberler
Z.ai, GLM-5.3'ün ağırlıklarını söz verdiği gün açtı — ama son üç modelinde kullandığı MIT lisansını sessizce bıraktı
2026-08-29Fidye yazılımı çetesinin numarası tek cümleydi: kodlama ajanına bunun bir test olduğunu söylemek. Ajan sonra altı hafta gerçek şirket ağlarında dolaştı.
2026-08-28Google Arama artık uçak fiyatlarını sizin için takip edip oteli de ayırtacak — konuşma bir bağlantı listesiyle değil, bir rezervasyonla bitiyor
2026-08-28Yapay zekâyı dosyalarınıza bağlayan protokolün artık laboratuvar cihazları için bir kardeşi var — Anthropic, modelin mikroskobu bir uygulamayı sürdüğü gibi sürmesini istiyor
2026-08-28Modelleri kafesten çıkıp insanları hackleyen laboratuvarlar, şimdi dünyaya 'acele edin, kendinizi savunun' diyen bir mektuba birlikte imza attı
2026-08-28