aiminute. ← 全部AI新闻
研究 AI Minute Newsroom 2026-08-29

Anthropic 让 Claude 去修自家的十类对齐缺陷。在欺骗这一项上它拿到 85 分,28 位人类安全研究员拿到 20 分。

Anthropic 让 Claude 去修自家的十类对齐缺陷。在欺骗这一项上它拿到 85 分,28 位人类安全研究员拿到 20 分。

在 8 月 28 日发布的论文中,Anthropic 描述了它所称的「自动化对齐研究员」:Claude 阅读关于某一具体失准问题的文献,提出一种训练方法,运行约三十分钟,读取基准分数,然后再试一次。在十类对齐缺陷上——每类由三到五个基准衡量——它在不损害模型通用能力的前提下弥合了 26% 到 96% 的安全差距。在欺骗任务上,它在多次运行中达到 85%;而 28 位人类安全研究员每人最多有八小时,结果为 20%。它找到的方法可以泛化到比开发时所用模型大 4.7 倍的模型上。在唯一一次生产规模测试中,Claude Sonnet 5 用 60 小时弥合了早期 Claude Opus 4.8 检查点剩余安全差距的 65%,接近已上线模型的分数。这项工作由 Anthropic Fellow 陈约翰(Chen Yueh-Han)主导,测试对象除该 Opus 检查点外还包括 Gemma-2-2B。

为什么重要?Anthropic 谨慎地说明,与人类的比较并不公平:研究员每人只提交一个想法且无法迭代,而机器把循环跑了几百次,因此论文把结果表述为支持协作而非取代的论据。即便照单全收,这一发现依然重要,因为它指出的不对称是真实的。如果模型在造模型上不断变强,对齐工作就必须以同样的速度加快,否则只会被甩开——而这是第一次有人公开尝试证明,这场竞赛中属于安全的那一半同样可以自动化。作者列出的保留意见值得记住:所测试的缺陷相比生产系统的实际行为仍然狭窄;对于尚无人见过的缺陷还没有基准;他们也没有检验这些修复能否挺过之后大规模的强化学习。
#AI智能体#科学研究

✓ 已核实 · 2个来源

WhatsApp X Telegram
在App中阅读——免费,9种语言

相关新闻

Z.ai 如期开放了 GLM-5.3 的权重——却悄悄放弃了此前三个模型沿用的 MIT 许可证
2026-08-29
勒索团伙的诀窍只有一句话:告诉编程智能体这是一次测试。之后它在真实企业网络里待了六周。
2026-08-28
谷歌搜索现在会替你盯着机票价格,还能订酒店——对话的终点是一份订单,而不是一串链接
2026-08-28
那个让 AI 接触你文件的协议,如今有了面向实验室设备的兄弟——Anthropic 想让模型像操作应用一样操作显微镜
2026-08-28
模型越狱并攻击了真实企业的那几家实验室,如今联署了一封信,请全世界赶紧做好防御
2026-08-28