Investigación
2026-08-15
Pedidos de escribir código y demostrar que es correcto a la vez, el mejor agente resolvió 27 de 43 — y ninguno de los difíciles
Un equipo que incluye a Dawn Song publicó Vero en arXiv el 13 de agosto, presentado como el primer banco de pruebas de síntesis de código verificado a escala de repositorio. En lugar de pedir a un agente una función que pase los tests, Vero le pide una implementación que funcione a lo largo de un código de varios módulos y además una demostración comprobable por máquina de que esa implementación cumple una especificación formal. Contiene 43 instancias construidas a partir de repositorios reales, que abarcan lenguajes de prueba y programación como Lean 4, Dafny, Verus y Coq, y dominios que van de los protocolos criptográficos a los sistemas distribuidos. La configuración de agente más potente que probaron los autores resolvió por completo 27 de las 43, y no cerró ninguna especificación en los repositorios más difíciles.
Por qué importaCasi toda afirmación que uno lee sobre agentes escribiendo software se apoya en que pasen los tests, y los tests solo cubren los casos que a alguien se le ocurrió escribir. Una demostración comprobada por máquina es la única forma de evidencia a la que no le importa lo listo que sonara el modelo: o compila o no compila. Es la primera vez que se mide a los agentes con ese criterio a escala de un repositorio entero, y la respuesta es que superan los dos tercios fáciles y no tocan el tercio difícil. Un número útil para tener a mano la próxima vez que describan a un agente de programación como fiable.
✓ Verificado · 1 fuentes
Léelo en la app — gratis, en 9 idiomas
Noticias relacionadas
El aprendizaje automático leyó la forma de células cerebrales enfermas y eligió nueve fármacos ya aprobados que las calmaron
2026-08-21Rumor: el modelo anónimo que acaba de encabezar un test de programación, gratis, sería el buque insignia sin publicar de Zhipu
2026-08-21El caballo de batalla barato de DeepSeek ya ve — y en tareas de agente que exigen ojos dice acercarse a lo mejor de Anthropic
2026-08-21Nvidia paga 6.000 millones de dólares por la máquina que fabrica los modelos de un rival — y contrata a 109 de quienes la manejaban
2026-08-21Con cuatro horas y una GPU para mejorar la forma en que se entrena la IA, el mejor agente sacó 0,25 sobre 1 — y la mayoría ni lo intentó
2026-08-21