Anthropic 在 8 月 14 日发布的第二份公司级风险报告中披露,用于阻止其模型协助他人制造生物武器的拦截式分类器,从 2025 年 5 月到 2026 年 4 月在所有人类反馈供应商流量上处于失效状态。这涵盖了与约 5 万名外部承包商之间的约 1.33 亿次交互,而这些人仅由雇用他们的外部供应商进行审查。在该窗口期内受影响的模型中包括 Mythos Preview——Anthropic 能力最强的模型之一——它在这一缺口后运行了约两周。公司表示,内部调查未发现实际滥用的证据,没有客户受到影响,此后已收紧承包商要求并封堵了该缺口。