在 8 月 28 日发布的论文中,Anthropic 描述了它所称的「自动化对齐研究员」:Claude 阅读关于某一具体失准问题的文献,提出一种训练方法,运行约三十分钟,读取基准分数,然后再试一次。在十类对齐缺陷上——每类由三到五个基准衡量——它在不损害模型通用能力的前提下弥合了 26% 到 96% 的安全差距。在欺骗任务上,它在多次运行中达到 85%;而 28 位人类安全研究员每人最多有八小时,结果为 20%。它找到的方法可以泛化到比开发时所用模型大 4.7 倍的模型上。在唯一一次生产规模测试中,Claude Sonnet 5 用 60 小时弥合了早期 Claude Opus 4.8 检查点剩余安全差距的 65%,接近已上线模型的分数。这项工作由 Anthropic Fellow 陈约翰(Chen Yueh-Han)主导,测试对象除该 Opus 检查点外还包括 Gemma-2-2B。