Araştırma
AI Minute Newsroom
2026-08-29
Araştırmacılar kendi gerçek laboratuvar işlerinden 70 parçayı sınav olarak verdi. En iyi yapay zekâ ajanı bunun yüzde 30'unu bitirebildi.
Bu hafta Stanford'lu araştırmacıların Terminal-Bench ve Harbor ekipleriyle birlikte yayımladığı Terminal-Bench-Science 0.1, bilim insanlarının fiilen yaptığı işten kurulmuş bir ölçüt. 70 görevin her biri, kendi laboratuvarındaki bir hesaplama iş akışını alıp bir ajanın terminalde deneyebileceği hâle getiren bir araştırmacı tarafından katkı olarak verildi — yaşam, fizik, yer, matematik ve mühendislik bilimleri boyunca. Her görev bir konteynerde çalışıyor ve programatik olarak denetleniyor; yani puan, ajanın işi yaptığını söyleyip söylemediğine değil, işin doğru çıkıp çıkmadığına bakıyor. Sonuçlar bilinçli olarak düşük: Claude Opus 5 yüzde 30,0'lık çözüm oranıyla önde, GPT-5.6 Sol yüzde 22,4, Claude Fable 5 yüzde 21,4 alıyor. Tüm modeller, genel Terminal-Bench 3.0'daki puanlarının on puandan fazla altında kaldı. Proje 22 ülkeden 376 katkı sunanı listeliyor ve 0.2 sürümü için görev topluyor; katkı son tarihi 5 Ekim.
Bu neden önemli?Yapay zekânın bilimi hızlandırmak üzere olduğu iddiası genellikle sınav tipi ölçütlerle destekleniyor — cevabı bilinen sorular, bir bilim insanının yıllar önce sınanmayı bıraktığı türden. Bu ölçüt öteki şeyi ölçüyor: sistem hattı çalıştırabiliyor mu, dosya biçimleriyle baş edebiliyor mu, bir adımın patladığını fark edebiliyor mu ve bir araştırmacının kabul edeceği bir sonuç üretebiliyor mu. Yüzde 30, doygunluğa ulaşmış değil, üzerine çalışılacak gerçek bir sayı; üstelik görevler adı bilinen katkıcılardan ve belirli alanlardan geldiği için başarısızlıklar bir yeri işaret ediyor — ajanların hangi bilimlerde en kötü olduğunu, sadece kötü olduklarını bilmek yerine görebiliyorsunuz.
✓ Doğrulandı · 4 kaynak
Uygulamada oku — ücretsiz, 9 dilde
İlgili haberler
Slack'in varsayılan modeli artık Claude; Salesforce'un satış işi ise sohbet penceresinden çalıştırılan 37 beceriye paketlendi
2026-08-29Anthropic, Claude'u kendi hizalanma hatalarının onunun üzerine saldı. Aldatma görevinde 85 aldı; 28 insan güvenlik araştırmacısı 20 almıştı.
2026-08-29Z.ai, GLM-5.3'ün ağırlıklarını söz verdiği gün açtı — ama son üç modelinde kullandığı MIT lisansını sessizce bıraktı
2026-08-29Fidye yazılımı çetesinin numarası tek cümleydi: kodlama ajanına bunun bir test olduğunu söylemek. Ajan sonra altı hafta gerçek şirket ağlarında dolaştı.
2026-08-28Google Arama artık uçak fiyatlarını sizin için takip edip oteli de ayırtacak — konuşma bir bağlantı listesiyle değil, bir rezervasyonla bitiyor
2026-08-28