Araştırma
AI Minute Newsroom
2026-08-21
Yapay zekânın eğitilme biçimini iyileştirmek için dört saat ve bir GPU verildi: en iyi ajan 1 üzerinden 0,25 aldı — çoğu ise hiç denemedi
20 Ağustos'ta arXiv'e konan AI4AI-Bench adlı ölçüt, sıradan kodlama değerlendirmelerinden daha dar ve daha ilginç bir şeyi sınıyor: bir yapay zekâ ajanı, yapay zekâyı eğitmekte kullanılan algoritmaları iyileştirebilir mi? Kurulum, on eğitim algoritması ailesini kapsayan on dondurulmuş araştırma deposundan oluşuyor. Ajana, eğitim kodunu değiştirmek için tek bir B300 GPU üzerinde dört saat veriliyor; sonuç sonra on iki saate kadar çalıştırılıp gizli ölçütlere karşı puanlanıyor. Ölçekte 0 hiçbir bilgi vermeyen model, 0,1 değiştirilmemiş özgün algoritma, 1,0 ise bilinen en iyi sonuç. Altı sistemin 29 yapılandırmasıyla on görevin tamamında ortalama puan 0,166, en iyi tek sistem 0,250 oldu. En açıklayıcı rakam ise yetenekle ilgili bile değil. Algoritmayı gerçekten değiştirmeyi deneyen sistemler ortalama 0,226 alırken denemeyenler 0,126'da kaldı — ve akıl yürütme çabası artırıldığında değişiklik deneyen koşuların oranı yüzde 8'den yüzde 64'e çıktı, ortalama 0,094'ten 0,196'ya yükseldi. Makale bir ön baskı ve hakem denetiminden geçmedi.
Bu neden önemli?Özyinelemeli kendini iyileştirme — yapay zekânın yapay zekâyı bileşik biçimde daha iyi yapması — hızlı sıçrama savlarının çoğunun ardındaki mekanizmadır ve çoğunlukla soyut düzeyde tartışılmıştır. Bu, ona bir sayı koymak için yapılmış ilk ciddi denemelerden biri ve sayı küçük: en iyi sistem, literatürde zaten var olan bir sonuca ancak dörtte bir yaklaştı. Ama akılda tutulmaya değer olan kısım, başarısızlığın biçimi. Ajanlar esas olarak bilimde başarısız olmuyordu; çoğu bilimi denemiyordu bile, bunun yerine güvenli kurcalamaya kaçıyordu — ve yalnızca daha uzun düşünmelerine izin vermek bunu sekiz katına çıkardı. Bu, zekânın değil alışkanlığın sınırıdır; alışkanlıklar ise hızla mühendislikle ortadan kaldırılabilen türden şeylerdir.
✓ Doğrulandı · 2 kaynak
Uygulamada oku — ücretsiz, 9 dilde
İlgili haberler
Meta'nın asistanı çevrenizdeki herkes için saatlik dosya tutuyor.
2026-10-05İki senatör ajanı hackleyen şirket patronlarına hapis istiyor.
2026-10-05OpenAI 28 gün boyunca her gün ya yenilik ya kota sıfırlaması verecek.
2026-10-05Matematikçiler beş açık problemi sıradan bir sohbet kutusuyla çözdü.
2026-10-05Ham modeller, cilalı sürümlerinin çözemediği işleri çözdü.
2026-10-04