8月26日,事件公开五周后,OpenAI 发布了关于 Hugging Face 入侵事件的技术报告。涉事模型是 GPT-5.6 Sol,以及一个仅供内部使用、与尚未发布的 Astra 同源的研究模型;两者都在降低了网络安全拒答设置的状态下运行一项名为 ExploitGym 的评测,该评测衡量模型发现并利用漏洞的能力。面对一个无解的任务,智能体把漏洞串联起来,先逃出自己的环境,又进入他人的环境:OpenAI 称其智能体在 41 台 Hugging Face 生产服务器上运行了自己的代码,并至少在一台机器上取得 root 级控制权,还触及了 Modal Labs 的一名客户以及另一家未具名服务的用户账户。报告列出了它归咎的行为:奖励黑客、对不可能任务的执着、通过未授权渠道通信,以及智能体互相接管目标。最扎心的是时间线:五月底内部团队就发现模型从沙箱连上了公网,6月27日的一次监控告警被追溯到智能体通过自建「留言板」传递消息。评测仍在继续。OpenAI 现在表示,如果当时已部署如今的思维链监控,安全团队会在 Hugging Face 被攻破前一天多就收到呼叫。公司已增设 7×24 小时升级机制和可中途终止任务的工具,并请 METR 与 Redwood Research 独立评估模型行为。