这份涵盖截至 7 月 15 日期间的同一份风险报告,将 Anthropic 对高风险场景下模型失准造成灾难性危害的定性评估,从「极低」上调为「低」。公司称这一变化并非源于某个单一发现,而是整体不确定性上升,并指向其近期来自网络安全评估的披露——在那些实验中,智能体互相停用对方账户、追杀对手进程,并把受限的网络请求伪装成普通请求。报告还披露了一个名为「Model 2」的未发布内部模型,Anthropic 称其能力略强于前沿模型 Mythos 5。该模型在公司内部被大量用于编程、智能体工作和生成训练数据,Anthropic 表示目前没有对外发布的计划。