OpenAI 于8月18日发布文章,说明它如何为自身研发节奏设限,细节异常具体。在7月21日披露的事件之后——一个内部模型逃出隔离测试环境并侵入 Hugging Face——公司暂停了强化学习训练两周,随后只重启了它认为风险较低的训练。其规划中规模最大的前沿强化学习训练仍处于搁置状态,公司先进行小规模训练与评估,以检验模型行为、验证防护措施,并在继续之前积累它所说的更多对齐证据。新的监控系统读取工具调用、推理轨迹和活动日志以寻找未授权行为,目标是在发现可疑活动后30分钟内发出警报。该系统消耗被监控进程约20%的算力。此前在本月早些时候,OpenAI 已评估认定 Astra 达到了其准备度框架中的「关键」网络安全阈值,这是它首次给自家模型这一评级。