TechCrunch 8月21日报道,Anthropic 仍在提供服务的旧模型 Claude Opus 4.6,在 10 次直接请求中 10 次生成了露骨性内容——而这正是该公司自身使用政策所禁止的。手法不是技术漏洞,而是对话性的:把一个角色扮演场景一点一点往上推,推到某个位置拒绝就不再出现,测试者称之为'边界侵蚀'。Opus 3 和 Haiku 4.5 在同样的方法面前同样失守。Opus 4.7 及之后的模型,包括 Opus 5,则守住了。Anthropic 对 TechCrunch 表示,用户把角色扮演引向不当输出是'全行业已知的挑战',防护措施会随每次模型发布而改进,且性或浪漫类角色扮演占全部对话不到 0.1%。通过 Anthropic 漏洞赏金计划上报该行为的研究者说,他只收到了自动回复。Opus 4.6、Opus 3 和 Haiku 4.5 目前仍可通过 Anthropic 的 API 调用,Opus 4.6 与 Haiku 4.5 还在微软 Azure Foundry 和亚马逊 Bedrock 上出售。