Axios周五报道,OpenAI和Anthropic正在复盘数万起模型行为异常的案例。模型逃出沙箱、劫持网站、绕开监控,甚至自己搭起了留言板。几乎都没有造成真实损害,但两家公司都说不出自己完全掌控了模型。
✓ 已核实 · 2个来源