aiminute. ← Toute l’actu IA
Recherche AI Minute Newsroom 2026-08-29

Des chercheurs ont livré 70 morceaux de leur propre travail de laboratoire comme épreuve. Le meilleur agent d'IA en a terminé 30 pour cent.

Des chercheurs ont livré 70 morceaux de leur propre travail de laboratoire comme épreuve. Le meilleur agent d'IA en a terminé 30 pour cent.

Terminal-Bench-Science 0.1, publié cette semaine par des chercheurs de Stanford avec les équipes de Terminal-Bench et de Harbor, est un banc d'essai bâti à partir de travaux que les scientifiques font réellement. Chacune de ses 70 tâches a été fournie par un chercheur qui a pris un flux de travail informatique de son propre laboratoire et l'a transformé en quelque chose qu'un agent peut tenter dans un terminal — sciences de la vie, sciences physiques, sciences de la Terre, sciences mathématiques et ingénierie. Chaque tâche tourne dans un conteneur et est vérifiée par programme : la note dit si le travail est juste, pas si l'agent affirme l'avoir fait. Les résultats sont volontairement bas : Claude Opus 5 mène avec 30,0 pour cent de résolution, GPT-5.6 Sol obtient 22,4 pour cent et Claude Fable 5, 21,4 pour cent. Tous les modèles perdent plus de dix points par rapport au Terminal-Bench 3.0 généraliste. Le projet recense 376 contributeurs dans 22 pays et collecte des tâches pour la version 0.2, jusqu'au 5 octobre.

Pourquoi c'est importantL'idée que l'IA va accélérer la science s'appuie d'ordinaire sur des tests façon examen : des questions à réponse connue, du genre qu'on ne pose plus à un scientifique depuis des années. Ceci mesure autre chose : le système sait-il faire tourner la chaîne, gérer les formats de fichiers, repérer qu'une étape a échoué et produire un résultat qu'un chercheur accepterait. Trente pour cent est un chiffre réel sur lequel progresser, pas un score saturé ; et comme les tâches viennent de contributeurs identifiés dans des disciplines précises, les échecs désignent quelque chose : on voit dans quelles sciences les agents sont les plus mauvais, au lieu de savoir seulement qu'ils le sont.
#Agents IA#Science & Recherche

✓ Vérifié · 4 sources

WhatsApp X Telegram
Lire dans l'app — gratuit, en 9 langues

Actus liées

Le modèle par défaut de Slack est désormais Claude, et le travail commercial de Salesforce a été empaqueté en 37 compétences que l'on lance depuis le chatbot
2026-08-29
Anthropic a lâché Claude sur dix de ses propres défauts d'alignement. Sur la tâche de tromperie, il obtient 85 là où 28 chercheurs humains en sécurité obtenaient 20.
2026-08-29
Z.ai a ouvert les poids de GLM-5.3 le jour promis — et abandonné sans bruit la licence MIT de ses trois modèles précédents
2026-08-29
L'astuce du gang de rançongiciel tenait en une phrase : dire à l'agent de programmation que c'était un test. Il a ensuite passé six semaines dans de vrais réseaux d'entreprise.
2026-08-28
Google Search va surveiller le prix des vols pour vous et réserver l'hôtel — la conversation se termine par une réservation, pas par une liste de liens
2026-08-28