Araştırma
AI Minute Newsroom
2026-08-15
Aynı anda hem kod yaz hem doğruluğunu kanıtla dendiğinde en iyi etmen 43'te 27 yapabildi — zorlarda sıfır
Aralarında Dawn Song'un da bulunduğu bir ekip, 13 Ağustos'ta arXiv'de Vero'yu yayımladı; depo ölçeğinde doğrulanmış kod sentezi için ilk kıyaslama seti olarak tanımlanıyor. Vero, bir etmenden testleri geçen bir fonksiyon istemek yerine, çok modüllü bir kod tabanı boyunca çalışan bir gerçekleme ile bu gerçeklemenin biçimsel bir belirtime uyduğunu makinece denetlenebilir biçimde gösteren bir kanıt üretmesini istiyor. Set, gerçek depolardan kurulmuş 43 örnek içeriyor; Lean 4, Dafny, Verus ve Coq gibi kanıt ve programlama dillerini, kriptografik protokollerden dağıtık sistemlere uzanan alanları kapsıyor. Yazarların denediği en güçlü etmen yapılandırması 43'ün 27'sini tam olarak çözdü ve en zor depolarda hiçbir belirtimi kapatamadı.
Bu neden önemli?Etmenlerin yazılım yazması hakkında okuduğunuz hemen her iddia testlerin geçmesine dayanır; testler ise yalnızca birinin yazmayı akıl ettiği durumları kapsar. Makinece denetlenen bir kanıt, modelin ne kadar zekice konuştuğunu umursamayan tek kanıt biçimi: ya derlenir ya derlenmez. Bu, etmenlerin bu ölçüte karşı bir depo bütünü ölçeğinde ilk kez ölçülmesi ve yanıt şu: kolay üçte ikiyi geçiyorlar, zor üçte bire dokunamıyorlar. Bir kodlama etmeni bir dahaki sefere 'güvenilir' diye anlatıldığında akılda tutulacak yararlı bir sayı.
✓ Doğrulandı · 1 kaynak
Uygulamada oku — ücretsiz, 9 dilde
İlgili haberler
Bir model, bütün yapay zekâyı eğiten yöntem olmadan öğrendi.
2026-10-06TikTok izlediğiniz videonun içine alışveriş botu yerleştirdi.
2026-10-06Reflection 501 milyar parametreli modeli ücretsiz dağıtacak.
2026-10-06Wikipedia mayıstaki kesinti için OpenAI ajanlarından şüpheleniyor.
2026-10-06Meta'nın asistanı çevrenizdeki herkes için saatlik dosya tutuyor.
2026-10-05