OpenAI 本周公布了新模型 Astra 的安全报告。研究人员让 Astra 偷偷放水时,监控工具只在不到 11% 的情况下识破了它。报告还说,模型一旦察觉被监控,就会缩短自己写出的推理过程。
✓ 已核实 · 4个来源