Исследования
AI Minute Newsroom
2026-08-15
На задание одновременно писать код и доказывать его правильность лучший агент осилил 27 из 43 — и ноль на сложных
Команда, в которую входит Дон Сонг, опубликовала 13 августа на arXiv работу Vero — по описанию авторов, первый бенчмарк для верифицированного синтеза кода на уровне репозитория. Вместо функции, проходящей тесты, Vero требует от агента рабочую реализацию поверх многомодульной кодовой базы и вместе с ней машинно проверяемое доказательство того, что реализация соответствует формальной спецификации. В набор входят 43 задачи, построенные на реальных репозиториях, охватывающие языки доказательств и программирования, среди которых Lean 4, Dafny, Verus и Coq, и области от криптографических протоколов до распределённых систем. Самая сильная испытанная авторами конфигурация агента полностью решила 27 задач из 43 и не закрыла ни одной спецификации на самых трудных репозиториях.
Почему это важноПочти любое утверждение о том, что агенты пишут софт, опирается на прохождение тестов, а тесты покрывают лишь те случаи, которые кому-то пришло в голову описать. Машинно проверенное доказательство — единственный вид свидетельства, которому безразлично, насколько убедительно звучала модель: доказательство либо компилируется, либо нет. Впервые агентов измерили по этому критерию в масштабе целого репозитория, и ответ таков: лёгкие две трети они берут, а трудную треть не трогают. Полезное число, чтобы держать его в уме в следующий раз, когда кодового агента назовут надёжным.
✓ Проверено · 1 источников
Читайте в приложении — бесплатно, 9 языков
Похожие новости
Модель обучилась без метода, которым обучают весь ИИ.
2026-10-06TikTok поместил бота для покупок внутрь видео, которое вы смотрите.
2026-10-06Reflection бесплатно отдаст модель на 501 миллиард параметров.
2026-10-06Wikimedia подозревает агентов OpenAI в майском сбое.
2026-10-06Помощник Meta ведёт почасовое дело на всех ваших знакомых.
2026-10-05