Recherche
2026-08-15
Sommé d'écrire du code et d'en prouver la justesse en même temps, le meilleur agent en a réussi 27 sur 43 — et zéro sur les plus durs
Une équipe incluant Dawn Song a publié Vero sur arXiv le 13 août, présenté comme le premier jeu d'épreuves de synthèse de code vérifié à l'échelle d'un dépôt. Plutôt que de demander à un agent une fonction qui passe les tests, Vero lui demande une implémentation fonctionnelle répartie sur un code à plusieurs modules, accompagnée d'une preuve vérifiable par machine que cette implémentation respecte une spécification formelle. Il contient 43 instances construites à partir de dépôts réels, couvrant des langages de preuve et de programmation comme Lean 4, Dafny, Verus et Coq, et des domaines allant des protocoles cryptographiques aux systèmes distribués. La configuration d'agent la plus performante testée par les auteurs a entièrement résolu 27 des 43, sans fermer la moindre spécification sur les dépôts les plus difficiles.
Pourquoi c'est importantPresque toutes les affirmations que l'on lit sur les agents qui écrivent du logiciel reposent sur des tests qui passent, et les tests ne couvrent que les cas auxquels quelqu'un a pensé. Une preuve vérifiée par machine est la seule forme de preuve indifférente à l'habileté apparente du modèle : soit elle compile, soit elle ne compile pas. C'est la première fois que des agents sont mesurés à cette aune à l'échelle d'un dépôt entier, et la réponse est qu'ils franchissent les deux tiers faciles et ne touchent pas au tiers difficile. Un chiffre utile à garder en tête la prochaine fois qu'un agent de programmation sera présenté comme fiable.
✓ Vérifié · 1 sources
Lire dans l'app — gratuit, en 9 langues
Actus liées
L'apprentissage automatique a lu la forme de cellules cérébrales malades et retenu neuf médicaments déjà autorisés qui les ont apaisées
2026-08-21Rumeur : le modèle anonyme qui vient de dominer un test de programmation, gratuitement, serait le fleuron non publié de Zhipu
2026-08-21Le cheval de trait bon marché de DeepSeek voit désormais — et sur les tâches d'agent qui exigent des yeux, il se dit proche du meilleur d'Anthropic
2026-08-21Nvidia paie 6 milliards de dollars pour la machine qui fabrique les modèles d'un rival — et embauche 109 de ceux qui la faisaient tourner
2026-08-21Quatre heures et un GPU pour améliorer la façon dont on entraîne l'IA : le meilleur agent obtient 0,25 sur 1 — et la plupart n'ont même pas essayé
2026-08-21