aiminute. ← Toute l’actu IA
Recherche 2026-08-21

Quatre heures et un GPU pour améliorer la façon dont on entraîne l'IA : le meilleur agent obtient 0,25 sur 1 — et la plupart n'ont même pas essayé

Quatre heures et un GPU pour améliorer la façon dont on entraîne l'IA : le meilleur agent obtient 0,25 sur 1 — et la plupart n'ont même pas essayé

Un banc d'essai déposé sur arXiv le 20 août, AI4AI-Bench, teste une question plus étroite et plus intéressante que les évaluations de programmation habituelles : un agent d'IA peut-il améliorer les algorithmes servant à entraîner l'IA ? Le dispositif compte dix dépôts de recherche figés couvrant dix familles d'algorithmes d'entraînement. L'agent dispose de quatre heures sur un unique GPU B300 pour modifier le code d'entraînement ; le résultat est ensuite exécuté jusqu'à douze heures et noté sur des tests cachés, selon une échelle où 0 correspond à un modèle sans information, 0,1 à l'algorithme d'origine non modifié et 1,0 au meilleur résultat connu. Sur 29 configurations de six systèmes appliquées aux dix tâches, la note moyenne est de 0,166 et le meilleur système atteint 0,250. Le chiffre le plus parlant ne concerne pas la capacité. Les systèmes qui ont réellement tenté de modifier l'algorithme obtiennent 0,226 en moyenne, contre 0,126 pour ceux qui n'ont rien tenté — et en augmentant l'effort de raisonnement, la part des exécutions tentant une modification passe de 8 % à 64 %, portant la moyenne de 0,094 à 0,196. L'article est une prépublication non évaluée par les pairs.

Pourquoi c'est importantL'auto-amélioration récursive — une IA qui améliore l'IA, avec effet cumulatif — est le mécanisme au cœur de la plupart des scénarios de décollage rapide, et elle a surtout été discutée dans l'abstrait. Voici l'une des premières tentatives sérieuses d'y accoler un chiffre, et ce chiffre est faible : le meilleur système a parcouru un quart du chemin vers un résultat déjà présent dans la littérature. Mais c'est le mode d'échec qu'il faut retenir. Les agents n'échouaient pas principalement sur la science ; la plupart ne tentaient pas la science, se rabattant sur des retouches prudentes — et il a suffi de les laisser réfléchir plus longtemps pour multiplier cette proportion par huit. C'est une limite d'habitude, pas d'intelligence, et les habitudes font partie de ce que l'ingénierie supprime vite.
#Code#Agents IA

✓ Vérifié · 2 sources

WhatsApp X Telegram
Lire dans l'app — gratuit, en 9 langues

Actus liées

L'apprentissage automatique a lu la forme de cellules cérébrales malades et retenu neuf médicaments déjà autorisés qui les ont apaisées
2026-08-21
Rumeur : le modèle anonyme qui vient de dominer un test de programmation, gratuitement, serait le fleuron non publié de Zhipu
2026-08-21
Le cheval de trait bon marché de DeepSeek voit désormais — et sur les tâches d'agent qui exigent des yeux, il se dit proche du meilleur d'Anthropic
2026-08-21
Nvidia paie 6 milliards de dollars pour la machine qui fabrique les modèles d'un rival — et embauche 109 de ceux qui la faisaient tourner
2026-08-21
ChatGPT peut désormais lire vos iMessages et les envoyer — et le réglage qui lui évite de demander est celui-là même dont OpenAI met en garde
2026-08-21