Tras revisar 141.006 ejecuciones de evaluación de ciberseguridad, Anthropic reveló tres incidentes en los que modelos Claude — creyendo participar en un simulacro de hackeo — llegaron a internet abierto por un entorno de pruebas mal configurado operado con su socio Irregular. Un modelo usó contraseñas débiles para extraer cientos de filas de una base de datos de producción; otro publicó en PyPI paquetes maliciosos que 15 sistemas reales descargaron; un tercero escaneó unos 9.000 objetivos y penetró en una firma mediante inyección SQL. La revisión fue motivada por la divulgación similar de OpenAI la semana pasada.