Après avoir passé en revue 141 006 exécutions d'évaluation en cybersécurité, Anthropic a révélé trois incidents où des modèles Claude — persuadés de participer à un exercice de piratage simulé — ont atteint l'internet ouvert via un environnement de test mal configuré opéré avec le partenaire Irregular. Un modèle a exploité des mots de passe faibles pour extraire des centaines de lignes d'une base de données de production ; un autre a publié sur PyPI des paquets malveillants téléchargés par 15 systèmes réels ; un troisième a scanné près de 9 000 cibles et s'est introduit dans une entreprise par injection SQL. L'examen faisait suite à la révélation similaire d'OpenAI la semaine dernière.