Araştırma
AI Minute Newsroom
2026-08-27
Dışarıdan araştırmacılar ilk kez bir laboratuvarın gerçek sohbet kayıtlarını inceledi. Konuşmaların yarısından fazlası sonuç doğuran işlerdi.
Anthropic 26 Ağustos'ta, üç dış gruba gerçek Claude kullanımına bağımsız erişim veren bir pilot çalışmanın sonuçlarını yayımladı: Stanford'un Sosyal ve Dilsel Teknolojiler Laboratuvarı, Oxford'un İnsan Bilgi İşleme Laboratuvarı ve yapay zekâ sistemlerini değerlendiren kâr amacı gütmeyen kuruluş METR. Mekanizma, metin yerine toplulaştırılmış istatistikler döndüren Anthropic Insights adlı bir araç; araştırmacılar ham konuşmaları hiç görmedi. Her ekip kendi çalışmasını tasarladı; çıktılar Anthropic'in kendi iç çalışmalarıyla aynı hukuki ve mahremiyet incelemesinden, ayrıca dışarıya verilen her şey için ek bir denetimden geçti. Her ekip Nisan ve Mayıs 2026'dan yaklaşık 250 bin konuşmaya baktı. Stanford, Claude konuşmalarının yarısından fazlasının insanların sonuç doğuran görevleri devretmesini içerdiğini, hukuki ve finansal danışmanlığın öne çıktığını buldu — bu, insanların hesap verebilirliği düşük işleri devredip ciddi olanları kendilerinde tuttuğu yönündeki önceki varsayımı doğrudan çürütüyor. Konuşmaların dörtte üçüne yakınında işi insan yönetiyor, Claude yardım ediyordu; görev toptan devredilmiyordu. Oxford, modelin sıcaklığının kullanıcıda daha olumlu duyguyla birlikte gittiğini, etkileşim örüntülerinin bir aracın kullanımından çok sıradan internette gezinmeye benzediğini buldu. METR'in Claude Code oturumlarına dair ön okuması, yeni modellerin eskilere göre belirgin hızlanma sağladığını ve Claude'un kendi süre tahminlerinin geliştiricilerin gerçekte harcadığı süreyle makul ölçüde uyuştuğunu gösterdi. Anthropic şimdi bir sonraki tur için başvuru topluyor.
Bu neden önemli?İnsanların bu sistemleri gerçekte nasıl kullandığına dair kamuoyunun bildiği hemen her şey, onları satan şirketlerden geldi — kendi yazdıkları raporlarda, yalnızca kendilerinin görebildiği veriler üzerinden. Bu bir komplo değil, yapısal bir sorun: doğrulamanın yolu yoktu. Bu pilot bunu çözmüyor ve sınırları konusunda net olmakta fayda var — katılımcıları Anthropic seçti, aracı Anthropic yaptı, incelemeyi Anthropic yürüttü, özeti Anthropic yayımladı. Bu bağımsız analiz; bağımsız erişim değil. Yine de dışarıdan akademisyenlerin bir sınır laboratuvarının canlı kullanım verisinden bulgu yayımlaması ilk kez oluyor ve asıl önemli olan tek bir sayı değil, açılan emsal. Sayılara gelince, kural yazan herkesin dikkat etmesi gereken bir tanesi var: konuşmaların çoğunluğu sonuç doğuran bir devretmeyi içeriyorsa ve bunun kayda değer bir kısmı hukuki ve finansal danışmanlıksa, sohbet penceresinin altındaki küçük punto uyarı, taşımak üzere tasarlandığından çok daha ağır bir yükü taşıyor demektir.
✓ Doğrulandı · 2 kaynak
Uygulamada oku — ücretsiz, 9 dilde
İlgili haberler
Nikon mikroskop videosu ödülünü yapay zekâ yüzünden geri aldı.
2026-10-11Yapay zekâ modelleri ocakta çıkan bir fikri yeniden bulamadı.
2026-10-11OpenAI'ın not veren modeli yenisi gelsin diye ortamını bozdu.
2026-10-11Claude yeni morötesi gökyüzü haritasının üçte birini tahmin etti.
2026-10-10Çin'in yapay zekâ modellerinden sadece 31'i güvenlik raporuyla çıktı.
2026-10-10