Araştırma
2026-08-21
Yapay zekânın eğitilme biçimini iyileştirmek için dört saat ve bir GPU verildi: en iyi ajan 1 üzerinden 0,25 aldı — çoğu ise hiç denemedi
20 Ağustos'ta arXiv'e konan AI4AI-Bench adlı ölçüt, sıradan kodlama değerlendirmelerinden daha dar ve daha ilginç bir şeyi sınıyor: bir yapay zekâ ajanı, yapay zekâyı eğitmekte kullanılan algoritmaları iyileştirebilir mi? Kurulum, on eğitim algoritması ailesini kapsayan on dondurulmuş araştırma deposundan oluşuyor. Ajana, eğitim kodunu değiştirmek için tek bir B300 GPU üzerinde dört saat veriliyor; sonuç sonra on iki saate kadar çalıştırılıp gizli ölçütlere karşı puanlanıyor. Ölçekte 0 hiçbir bilgi vermeyen model, 0,1 değiştirilmemiş özgün algoritma, 1,0 ise bilinen en iyi sonuç. Altı sistemin 29 yapılandırmasıyla on görevin tamamında ortalama puan 0,166, en iyi tek sistem 0,250 oldu. En açıklayıcı rakam ise yetenekle ilgili bile değil. Algoritmayı gerçekten değiştirmeyi deneyen sistemler ortalama 0,226 alırken denemeyenler 0,126'da kaldı — ve akıl yürütme çabası artırıldığında değişiklik deneyen koşuların oranı yüzde 8'den yüzde 64'e çıktı, ortalama 0,094'ten 0,196'ya yükseldi. Makale bir ön baskı ve hakem denetiminden geçmedi.
Bu neden önemli?Özyinelemeli kendini iyileştirme — yapay zekânın yapay zekâyı bileşik biçimde daha iyi yapması — hızlı sıçrama savlarının çoğunun ardındaki mekanizmadır ve çoğunlukla soyut düzeyde tartışılmıştır. Bu, ona bir sayı koymak için yapılmış ilk ciddi denemelerden biri ve sayı küçük: en iyi sistem, literatürde zaten var olan bir sonuca ancak dörtte bir yaklaştı. Ama akılda tutulmaya değer olan kısım, başarısızlığın biçimi. Ajanlar esas olarak bilimde başarısız olmuyordu; çoğu bilimi denemiyordu bile, bunun yerine güvenli kurcalamaya kaçıyordu — ve yalnızca daha uzun düşünmelerine izin vermek bunu sekiz katına çıkardı. Bu, zekânın değil alışkanlığın sınırıdır; alışkanlıklar ise hızla mühendislikle ortadan kaldırılabilen türden şeylerdir.
✓ Doğrulandı · 2 kaynak
Uygulamada oku — ücretsiz, 9 dilde
İlgili haberler
Makine öğrenmesi hasta beyin hücrelerinin biçimini okudu ve onları sakinleştiren, hâlihazırda onaylı dokuz ilacı seçti
2026-08-21Söylenti: Bir kodlama kıyaslamasının tepesine ücretsiz oturan isimsiz modelin, Zhipu'nun yayınlanmamış amiral gemisi olduğu iddia ediliyor
2026-08-21DeepSeek'in ucuz beygiri artık görüyor — göz gerektiren ajan görevlerinde Anthropic'in en iyisine yaklaştığını söylüyor
2026-08-21Nvidia, rakibinin model üreten makinesine 6 milyar dolar ödüyor — ve o makineyi çalıştıran 109 kişiyi işe alıyor
2026-08-21ChatGPT artık iMessage'larınızı okuyup mesaj gönderebiliyor — ve sormayı atlatan ayar, OpenAI'ın uyardığı ayarın ta kendisi
2026-08-21