aiminute. ← Tüm AI haberleri
Araştırma 2026-08-22

Model tek başına yüzde 30 aldı. Nvidia'nın iskeletine sarıldığında aynı model hepsini bitirdi.

Model tek başına yüzde 30 aldı. Nvidia'nın iskeletine sarıldığında aynı model hepsini bitirdi.

Nvidia 21 Ağustos'ta AVO'nun (Agentic Variation Operators) sonuçlarını yayımladı: genel amaçlı bir kodlama ajanı sistemi olan AVO, etkileşimli akıl yürütme ölçütü ARC-AGI-3'ün açık setindeki 25 ortamın tamamında 183 seviyenin hepsini bitirdi ve ölçütün insana göreli eylem verimliliği puanında 100.00 aldı. Bu ortamlar ajana ne talimat, ne kural, ne de hedef veriyor; oyunun ne olduğunu oynayarak çözmesi gerekiyor. Düşünme işini yapan dil modeli Anthropic'in Claude Opus 5'iydi; aynı model tek başına ve yüksek akıl yürütme çabasıyla çalıştırıldığında aynı sette ancak yüzde 30 civarında kalıyor. AVO 6.624 ortam eylemi kullandı, bir önceki en iyi sonuç olan VISTA'dan yaklaşık yüzde 12 daha az. Nvidia sonucun yalnızca 25 ortamlık açık seti kapsadığını, yarı gizli veya gizli yarışma setlerini kapsamadığını belirtiyor.

Bu neden önemli?İki yıldır işleyen varsayım, ilerlemenin bir sonraki modelle geleceğiydi. Bu sonuç, ilerlemenin büyük bir bölümünün artık halihazırda satın alabildiğiniz bir modelin etrafına sarılan yazılımdan geldiğini söylüyor: hafıza, planlama, denetim ve kendi işini gözden geçirip yeniden deneyen bir döngü. Aynı ağırlıklar yeniden eğitilmeden ölçütün üçte birinden tamamına çıktı. Bu, mühendislik emeğinin nereye gitmesi gerektiğini değiştiriyor ve bir ürünün hangi modeli kullandığı sorusunu, o ürünün gerçekte ne yapabileceğinin çok daha zayıf bir göstergesi haline getiriyor.
#Kodlama#Ajanlar

✓ Doğrulandı · 3 kaynak

▶ İlgili video: Interactive Reasoning Benchmarks | ARC-AGI-3 Preview
WhatsApp X Telegram
Uygulamada oku — ücretsiz, 9 dilde

İlgili haberler

Amerikalıların dörtte üçü yakınında veri merkezi istemiyor. Bir yıl önce ikiye bölünmüşlerdi.
2026-08-22
Anthropic en güçlü modelini kodunuzdaki açıkları avlaması için salıyor ama onunla konuşmanıza izin vermiyor
2026-08-22
Makine öğrenmesi hasta beyin hücrelerinin biçimini okudu ve onları sakinleştiren, hâlihazırda onaylı dokuz ilacı seçti
2026-08-21
Söylenti: Bir kodlama kıyaslamasının tepesine ücretsiz oturan isimsiz modelin, Zhipu'nun yayınlanmamış amiral gemisi olduğu iddia ediliyor
2026-08-21
DeepSeek'in ucuz beygiri artık görüyor — göz gerektiren ajan görevlerinde Anthropic'in en iyisine yaklaştığını söylüyor
2026-08-21