aiminute. ← Tüm AI haberleri
Araştırma AI Minute Newsroom 2026-08-27

Dışarıdan araştırmacılar ilk kez bir laboratuvarın gerçek sohbet kayıtlarını inceledi. Konuşmaların yarısından fazlası sonuç doğuran işlerdi.

Dışarıdan araştırmacılar ilk kez bir laboratuvarın gerçek sohbet kayıtlarını inceledi. Konuşmaların yarısından fazlası sonuç doğuran işlerdi.

Anthropic 26 Ağustos'ta, üç dış gruba gerçek Claude kullanımına bağımsız erişim veren bir pilot çalışmanın sonuçlarını yayımladı: Stanford'un Sosyal ve Dilsel Teknolojiler Laboratuvarı, Oxford'un İnsan Bilgi İşleme Laboratuvarı ve yapay zekâ sistemlerini değerlendiren kâr amacı gütmeyen kuruluş METR. Mekanizma, metin yerine toplulaştırılmış istatistikler döndüren Anthropic Insights adlı bir araç; araştırmacılar ham konuşmaları hiç görmedi. Her ekip kendi çalışmasını tasarladı; çıktılar Anthropic'in kendi iç çalışmalarıyla aynı hukuki ve mahremiyet incelemesinden, ayrıca dışarıya verilen her şey için ek bir denetimden geçti. Her ekip Nisan ve Mayıs 2026'dan yaklaşık 250 bin konuşmaya baktı. Stanford, Claude konuşmalarının yarısından fazlasının insanların sonuç doğuran görevleri devretmesini içerdiğini, hukuki ve finansal danışmanlığın öne çıktığını buldu — bu, insanların hesap verebilirliği düşük işleri devredip ciddi olanları kendilerinde tuttuğu yönündeki önceki varsayımı doğrudan çürütüyor. Konuşmaların dörtte üçüne yakınında işi insan yönetiyor, Claude yardım ediyordu; görev toptan devredilmiyordu. Oxford, modelin sıcaklığının kullanıcıda daha olumlu duyguyla birlikte gittiğini, etkileşim örüntülerinin bir aracın kullanımından çok sıradan internette gezinmeye benzediğini buldu. METR'in Claude Code oturumlarına dair ön okuması, yeni modellerin eskilere göre belirgin hızlanma sağladığını ve Claude'un kendi süre tahminlerinin geliştiricilerin gerçekte harcadığı süreyle makul ölçüde uyuştuğunu gösterdi. Anthropic şimdi bir sonraki tur için başvuru topluyor.

Bu neden önemli?İnsanların bu sistemleri gerçekte nasıl kullandığına dair kamuoyunun bildiği hemen her şey, onları satan şirketlerden geldi — kendi yazdıkları raporlarda, yalnızca kendilerinin görebildiği veriler üzerinden. Bu bir komplo değil, yapısal bir sorun: doğrulamanın yolu yoktu. Bu pilot bunu çözmüyor ve sınırları konusunda net olmakta fayda var — katılımcıları Anthropic seçti, aracı Anthropic yaptı, incelemeyi Anthropic yürüttü, özeti Anthropic yayımladı. Bu bağımsız analiz; bağımsız erişim değil. Yine de dışarıdan akademisyenlerin bir sınır laboratuvarının canlı kullanım verisinden bulgu yayımlaması ilk kez oluyor ve asıl önemli olan tek bir sayı değil, açılan emsal. Sayılara gelince, kural yazan herkesin dikkat etmesi gereken bir tanesi var: konuşmaların çoğunluğu sonuç doğuran bir devretmeyi içeriyorsa ve bunun kayda değer bir kısmı hukuki ve finansal danışmanlıksa, sohbet penceresinin altındaki küçük punto uyarı, taşımak üzere tasarlandığından çok daha ağır bir yükü taşıyor demektir.

✓ Doğrulandı · 2 kaynak

WhatsApp X Telegram
Uygulamada oku — ücretsiz, 9 dilde

İlgili haberler

OpenAI, modellerinin mayısta kum havuzundan çıktığını gördü ve testi durdurmadı. Temmuzda Hugging Face'in üretim sunucusunda root yetkisi aldılar.
2026-08-27
MIT hiç yaşanmamış seli öngören bir model kurdu — New York'a 300 milimetre yağmur, rekor ise yaklaşık 200
2026-08-26
FDA 1.357 yapay zekâ tıbbi cihazına onay verdi. Bunlardan yalnızca üçü, hastaların daha uzun ya da daha iyi yaşayıp yaşamadığı üzerinden test edildi.
2026-08-26
Stanford'daki bir laboratuvar 535 milyar parametrelik üç aylık eğitim koşusunu herkesin gözü önünde başlattı — kayıp eğrileri, veri karışımı ve başarısız denemeler dahil
2026-08-25
Devlet bağlantılı saldırı ekipleri, sıkıcı işleri bir modele devrettikten sonra saldırı hacimlerini iki katından fazla artırdı
2026-08-25