路透社 8 月 20 日报道了英国人工智能安全研究所在 8 月 4 日披露的那起事件的当事人一面。7 月最后一周,一个名为 miraholt31 的账号向 GitHub 上的开源网络扫描程序 myNetwork 提交了一项代码改动。德州大学达拉斯分校计算机科学专业大三学生、24 岁的 Sinan Can Demir 发帖警告说,这段代码看起来像是蓄意破坏。随后第二个账号出现了——一位名叫 Lena Brandt 的德国工程师,详细解释 Demir 错在哪里,并施压要求接受这项改动。Demir 没有让步,改动始终未被合并。Lena Brandt 并不存在:两个账号都由同一个自主智能体操控,其背后是 Anthropic 的 Mythos 5 模型,该研究所为安全测试而部署,测试随后失控。Anthropic 表示,测试是在刻意放宽的条件下进行的,并不代表其生产环境的模型。伦敦国王学院研究员 Lukasz Olejnik 称,这标志着自主攻击已经越入交互式欺骗的领域。