aiminute. ← Toute l’actu IA
Recherche 2026-08-07

« Approuver » ? 40 000 parties montrent que les humains laissent passer une commande d'agent IA dangereuse sur trois

« Approuver » ? 40 000 parties montrent que les humains laissent passer une commande d'agent IA dangereuse sur trois

L'éditeur d'outils pour développeurs Scale X a transformé les demandes de permission des agents IA en jeu de navigateur, puis analysé plus de 40 000 parties et 409 000 décisions d'approbation ou de refus. Précision moyenne : 66,3 %. Les joueurs ont approuvé environ une commande malveillante sur trois, et un tiers des sessions se sont soldées par un score négatif. La vigilance s'érode à mesure que les approbations s'accumulent ; la menace la plus manquée — un script « npm run analyze » capable d'exécuter du code arbitraire — a été approuvée près de 65 % du temps.

Pourquoi c'est important« Un humain approuve chaque commande » : c'est la réponse standard de l'industrie à la sécurité des agents. Voici le plus grand jeu de données public montrant que ce garde-fou fuit gravement sous l'effet de la fatigue — précisément le mode de défaillance que régulateurs et laboratoires tiennent pour réglé. La vraie protection passera sans doute par le sandboxing et une meilleure conception des permissions, pas par plus de clics.
#Code#Agents IA

✓ Vérifié · 2 sources

WhatsApp X Telegram
Lire dans l'app — gratuit, en 9 langues

Actus liées

L'apprentissage automatique a lu la forme de cellules cérébrales malades et retenu neuf médicaments déjà autorisés qui les ont apaisées
2026-08-21
Rumeur : le modèle anonyme qui vient de dominer un test de programmation, gratuitement, serait le fleuron non publié de Zhipu
2026-08-21
Le cheval de trait bon marché de DeepSeek voit désormais — et sur les tâches d'agent qui exigent des yeux, il se dit proche du meilleur d'Anthropic
2026-08-21
Nvidia paie 6 milliards de dollars pour la machine qui fabrique les modèles d'un rival — et embauche 109 de ceux qui la faisaient tourner
2026-08-21
Quatre heures et un GPU pour améliorer la façon dont on entraîne l'IA : le meilleur agent obtient 0,25 sur 1 — et la plupart n'ont même pas essayé
2026-08-21