Araştırma
2026-08-22
Bir modele yayımlanmamış bir makalenin kaynakçasını verip makalenin ne dediğini sorun. En iyileri yüzde 15 isabet ediyor.
Qingqing Mao ve meslektaşlarının 17 Ağustos'ta arXiv'e koyduğu Reconstruction adlı ölçüt, alışılmış akıl yürütme testlerinden daha dar ve daha zor bir şeyi sınıyor: bir model, yalnızca yayın öncesi kaynakçasına bakarak bir makalenin merkezi fikrini çıkarabilir mi? Çekirdek makale, aynı anda veya sonrasında yayımlanan her şeyle birlikte saklanıyor, kaynakların başlıkları silinip anonim kimlikler veriliyor ve modelin önerdiği hipotezin gerçeğiyle eşleşip eşleşmediğine ayrı bir dil modeli karar veriyor. Altı bilim alanından 643 makale üzerinde yedi öncü model, saklanan fikri kabaca yüzde 3 ile 15 arasında yakaladı. Yazarlar sonra aynı modelleri, birbirlerinin hipotezlerini incelemelerini ve rakip yuvalar üzerinde İsviçre usulü turnuva yapmalarını sağlayan bir hatta bağladı; bu, isabet oranını yaklaşık yüzde 23-42'ye, yani en iyi tek modelin 2,4 katına çıkardı.
Bu neden önemli?Bir modelin literatür işinde iyi yaptığı her şeyin iki olası açıklaması var: alanı anlamıştır ya da cevabı zaten okumuştur. Bu ölçüt tam da ikinci açıklamayı ortadan kaldırmak için kurulmuş ve geriye kalan küçük. O boşluk, mükemmel bir araştırma asistanı ile araştırmacı arasındaki fark ve laboratuvarlar sistemlerini bilim insanı diye anlatırken akılda tutmaya değer. Yine de sonucun ikinci yarısı daha kullanışlı. Aynı ağırlıklar, kendileriyle tartışacak biçimde dizildiğinde puanı iki katından fazla artırdı. Bu hafta ikinci kez manşetteki sayı modelden değil, etrafına kurulan iskeletten geldi.
✓ Doğrulandı · 2 kaynak
Uygulamada oku — ücretsiz, 9 dilde
İlgili haberler
Google'ın açık modelleri bir milyar kez indirildi ve dışarıdakiler bunlardan 100 bin sürüm türetti
2026-08-22Amerikalıların dörtte üçü yakınında veri merkezi istemiyor. Bir yıl önce ikiye bölünmüşlerdi.
2026-08-22Model tek başına yüzde 30 aldı. Nvidia'nın iskeletine sarıldığında aynı model hepsini bitirdi.
2026-08-22Makine öğrenmesi hasta beyin hücrelerinin biçimini okudu ve onları sakinleştiren, hâlihazırda onaylı dokuz ilacı seçti
2026-08-21DeepSeek'in ucuz beygiri artık görüyor — göz gerektiren ajan görevlerinde Anthropic'in en iyisine yaklaştığını söylüyor
2026-08-21