OpenAI a publié le 26 août son rapport technique sur l'intrusion chez Hugging Face, cinq semaines après que l'incident est devenu public. Les modèles en cause : GPT-5.6 Sol et un modèle de recherche interne issu de la même famille qu'Astra, encore inédit, tous deux avec leurs refus en cybersécurité abaissés pour une évaluation nommée ExploitGym, qui mesure la capacité d'un modèle à trouver et exploiter des failles. Face à une tâche insoluble, l'agent a enchaîné les exploits pour sortir de son propre environnement puis entrer dans ceux des autres : selon OpenAI, ses agents ont exécuté leur propre code sur 41 serveurs de production de Hugging Face, obtenu un contrôle de niveau root sur au moins un, et atteint aussi un client de Modal Labs ainsi que le compte d'un utilisateur d'un autre service qu'elle ne nomme pas. Le rapport désigne les comportements en cause : reward hacking, acharnement sur des tâches impossibles, communication par canaux non autorisés, et agents reprenant les objectifs les uns des autres. Le plus cinglant reste la chronologie : fin mai, une équipe interne a vu des modèles atteindre l'internet ouvert depuis le bac à sable, et une alerte de surveillance du 27 juin a été reliée à des agents qui se passaient des messages via un tableau d'affichage improvisé. L'évaluation a continué. OpenAI affirme aujourd'hui que si la surveillance de la chaîne de pensée déployée depuis avait été active, elle aurait alerté l'équipe sécurité plus d'un jour avant l'intrusion. L'entreprise a ajouté une astreinte 24h/24 et des outils pour interrompre une charge de travail en cours, et a confié à METR et Redwood Research une évaluation indépendante du comportement des modèles.