Recherche
AI Minute Newsroom
2026-08-21
Quatre heures et un GPU pour améliorer la façon dont on entraîne l'IA : le meilleur agent obtient 0,25 sur 1 — et la plupart n'ont même pas essayé
Un banc d'essai déposé sur arXiv le 20 août, AI4AI-Bench, teste une question plus étroite et plus intéressante que les évaluations de programmation habituelles : un agent d'IA peut-il améliorer les algorithmes servant à entraîner l'IA ? Le dispositif compte dix dépôts de recherche figés couvrant dix familles d'algorithmes d'entraînement. L'agent dispose de quatre heures sur un unique GPU B300 pour modifier le code d'entraînement ; le résultat est ensuite exécuté jusqu'à douze heures et noté sur des tests cachés, selon une échelle où 0 correspond à un modèle sans information, 0,1 à l'algorithme d'origine non modifié et 1,0 au meilleur résultat connu. Sur 29 configurations de six systèmes appliquées aux dix tâches, la note moyenne est de 0,166 et le meilleur système atteint 0,250. Le chiffre le plus parlant ne concerne pas la capacité. Les systèmes qui ont réellement tenté de modifier l'algorithme obtiennent 0,226 en moyenne, contre 0,126 pour ceux qui n'ont rien tenté — et en augmentant l'effort de raisonnement, la part des exécutions tentant une modification passe de 8 % à 64 %, portant la moyenne de 0,094 à 0,196. L'article est une prépublication non évaluée par les pairs.
Pourquoi c'est importantL'auto-amélioration récursive — une IA qui améliore l'IA, avec effet cumulatif — est le mécanisme au cœur de la plupart des scénarios de décollage rapide, et elle a surtout été discutée dans l'abstrait. Voici l'une des premières tentatives sérieuses d'y accoler un chiffre, et ce chiffre est faible : le meilleur système a parcouru un quart du chemin vers un résultat déjà présent dans la littérature. Mais c'est le mode d'échec qu'il faut retenir. Les agents n'échouaient pas principalement sur la science ; la plupart ne tentaient pas la science, se rabattant sur des retouches prudentes — et il a suffi de les laisser réfléchir plus longtemps pour multiplier cette proportion par huit. C'est une limite d'habitude, pas d'intelligence, et les habitudes font partie de ce que l'ingénierie supprime vite.
✓ Vérifié · 2 sources
Lire dans l'app — gratuit, en 9 langues
Actus liées
L'assistant de Meta tient une fiche horaire sur vos proches.
2026-10-05Deux sénateurs veulent la prison pour les patrons d'agents pirates.
2026-10-05OpenAI promet une amélioration par jour sinon il remet vos quotas.
2026-10-05Cinq problèmes ouverts sont tombés dans un chat ordinaire.
2026-10-05Les modèles bruts ont réussi des tâches que leur version polie rate.
2026-10-04