aiminute. ← Toute l’actu IA
Recherche AI Minute Newsroom 2026-08-15

Sommé d'écrire du code et d'en prouver la justesse en même temps, le meilleur agent en a réussi 27 sur 43 — et zéro sur les plus durs

Sommé d'écrire du code et d'en prouver la justesse en même temps, le meilleur agent en a réussi 27 sur 43 — et zéro sur les plus durs

Une équipe incluant Dawn Song a publié Vero sur arXiv le 13 août, présenté comme le premier jeu d'épreuves de synthèse de code vérifié à l'échelle d'un dépôt. Plutôt que de demander à un agent une fonction qui passe les tests, Vero lui demande une implémentation fonctionnelle répartie sur un code à plusieurs modules, accompagnée d'une preuve vérifiable par machine que cette implémentation respecte une spécification formelle. Il contient 43 instances construites à partir de dépôts réels, couvrant des langages de preuve et de programmation comme Lean 4, Dafny, Verus et Coq, et des domaines allant des protocoles cryptographiques aux systèmes distribués. La configuration d'agent la plus performante testée par les auteurs a entièrement résolu 27 des 43, sans fermer la moindre spécification sur les dépôts les plus difficiles.

Pourquoi c'est importantPresque toutes les affirmations que l'on lit sur les agents qui écrivent du logiciel reposent sur des tests qui passent, et les tests ne couvrent que les cas auxquels quelqu'un a pensé. Une preuve vérifiée par machine est la seule forme de preuve indifférente à l'habileté apparente du modèle : soit elle compile, soit elle ne compile pas. C'est la première fois que des agents sont mesurés à cette aune à l'échelle d'un dépôt entier, et la réponse est qu'ils franchissent les deux tiers faciles et ne touchent pas au tiers difficile. Un chiffre utile à garder en tête la prochaine fois qu'un agent de programmation sera présenté comme fiable.
#Code#Agents IA

✓ Vérifié · 1 sources

WhatsApp X Telegram
Lire dans l'app — gratuit, en 9 langues

Actus liées

Un modèle a appris sans la méthode qui entraîne toutes les IA.
2026-10-06
TikTok a glissé un chatbot d'achat dans la vidéo que vous regardez.
2026-10-06
Reflection va offrir un modèle de 501 milliards de paramètres.
2026-10-06
Wikimédia soupçonne des agents d'OpenAI pour la panne de mai.
2026-10-06
L'assistant de Meta tient une fiche horaire sur vos proches.
2026-10-05