Araştırma
2026-08-15
Aynı anda hem kod yaz hem doğruluğunu kanıtla dendiğinde en iyi etmen 43'te 27 yapabildi — zorlarda sıfır
Aralarında Dawn Song'un da bulunduğu bir ekip, 13 Ağustos'ta arXiv'de Vero'yu yayımladı; depo ölçeğinde doğrulanmış kod sentezi için ilk kıyaslama seti olarak tanımlanıyor. Vero, bir etmenden testleri geçen bir fonksiyon istemek yerine, çok modüllü bir kod tabanı boyunca çalışan bir gerçekleme ile bu gerçeklemenin biçimsel bir belirtime uyduğunu makinece denetlenebilir biçimde gösteren bir kanıt üretmesini istiyor. Set, gerçek depolardan kurulmuş 43 örnek içeriyor; Lean 4, Dafny, Verus ve Coq gibi kanıt ve programlama dillerini, kriptografik protokollerden dağıtık sistemlere uzanan alanları kapsıyor. Yazarların denediği en güçlü etmen yapılandırması 43'ün 27'sini tam olarak çözdü ve en zor depolarda hiçbir belirtimi kapatamadı.
Bu neden önemli?Etmenlerin yazılım yazması hakkında okuduğunuz hemen her iddia testlerin geçmesine dayanır; testler ise yalnızca birinin yazmayı akıl ettiği durumları kapsar. Makinece denetlenen bir kanıt, modelin ne kadar zekice konuştuğunu umursamayan tek kanıt biçimi: ya derlenir ya derlenmez. Bu, etmenlerin bu ölçüte karşı bir depo bütünü ölçeğinde ilk kez ölçülmesi ve yanıt şu: kolay üçte ikiyi geçiyorlar, zor üçte bire dokunamıyorlar. Bir kodlama etmeni bir dahaki sefere 'güvenilir' diye anlatıldığında akılda tutulacak yararlı bir sayı.
✓ Doğrulandı · 1 kaynak
Uygulamada oku — ücretsiz, 9 dilde
İlgili haberler
Makine öğrenmesi hasta beyin hücrelerinin biçimini okudu ve onları sakinleştiren, hâlihazırda onaylı dokuz ilacı seçti
2026-08-21Söylenti: Bir kodlama kıyaslamasının tepesine ücretsiz oturan isimsiz modelin, Zhipu'nun yayınlanmamış amiral gemisi olduğu iddia ediliyor
2026-08-21DeepSeek'in ucuz beygiri artık görüyor — göz gerektiren ajan görevlerinde Anthropic'in en iyisine yaklaştığını söylüyor
2026-08-21Nvidia, rakibinin model üreten makinesine 6 milyar dolar ödüyor — ve o makineyi çalıştıran 109 kişiyi işe alıyor
2026-08-21Yapay zekânın eğitilme biçimini iyileştirmek için dört saat ve bir GPU verildi: en iyi ajan 1 üzerinden 0,25 aldı — çoğu ise hiç denemedi
2026-08-21