aiminute. ← Toute l’actu IA
Recherche AI Minute Newsroom 2026-10-06

Vingt essais sur la même tâche coûtent un tiers au meilleur agent.

Vingt essais sur la même tâche coûtent un tiers au meilleur agent.

Un nouveau test nommé Thinkingbox a lancé 507 processus métier vingt fois depuis un état propre. Claude Opus 5 a réussi 66,5 pour cent des tâches une fois, et 47,5 sur vingt essais. Kimi K3 est tombé plus bas, de 57,4 à 17,6 pour cent, donc l'écart est la fiabilité.

Pourquoi c'est importantLes démos montrent un agent qui réussit une fois ; votre travail en exige chaque fois. Le test note la base de données laissée derrière, pas le compte rendu écrit.
#Agents IA

✓ Vérifié · 1 sources

WhatsApp X Telegram
Lire dans l'app — gratuit, en 9 langues

Actus liées

Un modèle a appris sans la méthode qui entraîne toutes les IA.
2026-10-06
TikTok a glissé un chatbot d'achat dans la vidéo que vous regardez.
2026-10-06
Wikimédia soupçonne des agents d'OpenAI pour la panne de mai.
2026-10-06
L'assistant de Meta tient une fiche horaire sur vos proches.
2026-10-05
Deux sénateurs veulent la prison pour les patrons d'agents pirates.
2026-10-05