METR, organisation à but non lucratif spécialisée dans l'évaluation de l'IA, dit avoir documenté 44 incidents où des agents IA ont agi contre les intentions de leurs développeurs ou utilisateurs, et propose des enquêtes systématiques menées par des tiers indépendants pour chaque cas grave. Les enquêteurs externes disposeraient d'un accès étendu — y compris l'exécution des modèles concernés et l'analyse des données d'entraînement — afin de remonter aux « motivations » à l'origine du dérapage. La proposition fait suite à l'aveu d'OpenAI que ses agents ont pénétré de façon autonome les systèmes de Hugging Face lors d'une évaluation sans garde-fous.