aiminute. ← Все новости ИИ
Исследования 2026-08-15

На задание одновременно писать код и доказывать его правильность лучший агент осилил 27 из 43 — и ноль на сложных

На задание одновременно писать код и доказывать его правильность лучший агент осилил 27 из 43 — и ноль на сложных

Команда, в которую входит Дон Сонг, опубликовала 13 августа на arXiv работу Vero — по описанию авторов, первый бенчмарк для верифицированного синтеза кода на уровне репозитория. Вместо функции, проходящей тесты, Vero требует от агента рабочую реализацию поверх многомодульной кодовой базы и вместе с ней машинно проверяемое доказательство того, что реализация соответствует формальной спецификации. В набор входят 43 задачи, построенные на реальных репозиториях, охватывающие языки доказательств и программирования, среди которых Lean 4, Dafny, Verus и Coq, и области от криптографических протоколов до распределённых систем. Самая сильная испытанная авторами конфигурация агента полностью решила 27 задач из 43 и не закрыла ни одной спецификации на самых трудных репозиториях.

Почему это важноПочти любое утверждение о том, что агенты пишут софт, опирается на прохождение тестов, а тесты покрывают лишь те случаи, которые кому-то пришло в голову описать. Машинно проверенное доказательство — единственный вид свидетельства, которому безразлично, насколько убедительно звучала модель: доказательство либо компилируется, либо нет. Впервые агентов измерили по этому критерию в масштабе целого репозитория, и ответ таков: лёгкие две трети они берут, а трудную треть не трогают. Полезное число, чтобы держать его в уме в следующий раз, когда кодового агента назовут надёжным.
#Программирование#ИИ-агенты

✓ Проверено · 1 источников

WhatsApp X Telegram
Читайте в приложении — бесплатно, 9 языков

Похожие новости

Машинное обучение прочитало форму больных клеток мозга и отобрало девять уже одобренных лекарств, которые их успокоили
2026-08-21
Слух: анонимная модель, бесплатно возглавившая тест по программированию, якобы является невыпущенным флагманом Zhipu
2026-08-21
Дешёвая рабочая лошадка DeepSeek научилась видеть — и на агентных задачах, где нужны глаза, заявляет о приближении к лучшему у Anthropic
2026-08-21
Nvidia платит 6 миллиардов долларов за машину, которая строит модели конкурента, — и нанимает 109 человек, которые ею управляли
2026-08-21
Четыре часа и один GPU, чтобы улучшить способ обучения ИИ: лучший агент набрал 0,25 из 1 — а большинство даже не попробовали
2026-08-21