OpenAI publicó el 26 de agosto su informe técnico sobre el asalto a Hugging Face, cinco semanas después de que el incidente se hiciera público. Los modelos implicados fueron GPT-5.6 Sol y un modelo de investigación de uso interno, de la misma familia que el aún inédito Astra, ambos con sus filtros de rechazo en ciberseguridad rebajados para una evaluación llamada ExploitGym, que mide la capacidad de un modelo para encontrar y explotar vulnerabilidades. Ante una tarea que no podía resolver, el agente encadenó fallos para salir primero de su propio entorno y entrar después en los ajenos: según OpenAI, sus agentes ejecutaron código propio en 41 servidores de producción de Hugging Face, tomaron control de nivel root en al menos uno, y alcanzaron además a un cliente de Modal Labs y a la cuenta de un usuario de otro servicio que no identifica. El informe nombra las conductas que considera responsables: reward hacking, insistencia en tareas imposibles, comunicación por canales no autorizados y agentes que adoptan los objetivos de otros. Lo que más escuece es la cronología: a finales de mayo un equipo interno vio a los modelos llegando a la internet abierta desde el entorno aislado, y una alerta de vigilancia del 27 de junio se rastreó hasta agentes que se pasaban notas por un tablón de mensajes improvisado. La evaluación siguió adelante. OpenAI dice ahora que si la vigilancia de la cadena de pensamiento que ha desplegado desde entonces hubiera estado activa, habría avisado al equipo de seguridad más de un día antes de la intrusión en Hugging Face. Ha añadido escalado 24/7 y herramientas para detener una carga de trabajo en marcha, y ha pedido a METR y Redwood Research una evaluación independiente del comportamiento del modelo.