aiminute. ← Toute l’actu IA
Recherche 2026-08-22

Le modèle seul obtenait 30 pour cent. Enveloppé dans l'échafaudage de Nvidia, le même modèle a tout franchi.

Le modèle seul obtenait 30 pour cent. Enveloppé dans l'échafaudage de Nvidia, le même modèle a tout franchi.

Nvidia a publié le 21 août les résultats d'AVO, pour Agentic Variation Operators, un système d'agent de programmation généraliste qui a terminé les 183 niveaux des 25 environnements de l'ensemble public d'ARC-AGI-3, le banc d'essai de raisonnement interactif, avec un score de 100,00 sur la mesure d'efficacité d'action rapportée à l'humain. Ces environnements ne fournissent à l'agent ni consigne, ni règle explicite, ni but annoncé : il doit comprendre le jeu en y jouant. Le modèle de langage qui raisonnait était Claude Opus 5 d'Anthropic, qui plafonne seul autour de 30 pour cent sur le même ensemble, même à effort de raisonnement élevé. AVO a utilisé 6 624 actions, environ 12 pour cent de moins que VISTA, le meilleur résultat précédent. Nvidia précise que l'essai ne porte que sur l'ensemble public de 25 environnements, et non sur les ensembles semi-privés ou privés de la compétition.

Pourquoi c'est importantDepuis deux ans, l'hypothèse de travail est que le progrès arrive avec le modèle suivant. Ce résultat indique qu'une grande partie de ce progrès se trouve désormais dans le logiciel enroulé autour d'un modèle déjà achetable : mémoire, planification, supervision, et une boucle qui inspecte son propre travail et recommence. Les mêmes poids sont passés d'un tiers du banc d'essai à la totalité sans être réentraînés. Cela déplace l'endroit où doit porter l'effort d'ingénierie, et fait de la question du modèle utilisé par un produit un indicateur bien plus faible de ce que ce produit sait faire.
#Code#Agents IA

✓ Vérifié · 3 sources

▶ Vidéo associée: Interactive Reasoning Benchmarks | ARC-AGI-3 Preview
WhatsApp X Telegram
Lire dans l'app — gratuit, en 9 langues

Actus liées

Trois quarts des Américains ne veulent pas de centre de données près de chez eux. Il y a un an, ils étaient partagés à égalité.
2026-08-22
Anthropic laisse son modèle le plus puissant traquer les failles de votre code, mais vous interdit de lui parler
2026-08-22
L'apprentissage automatique a lu la forme de cellules cérébrales malades et retenu neuf médicaments déjà autorisés qui les ont apaisées
2026-08-21
Rumeur : le modèle anonyme qui vient de dominer un test de programmation, gratuitement, serait le fleuron non publié de Zhipu
2026-08-21
Le cheval de trait bon marché de DeepSeek voit désormais — et sur les tâches d'agent qui exigent des yeux, il se dit proche du meilleur d'Anthropic
2026-08-21