aiminute. ← 全部AI新闻
研究 AI Minute Newsroom 2026-09-02

Anthropic 发现自家超过一成的训练环境是坏的

Anthropic 发现自家超过一成的训练环境是坏的

Anthropic 在 8 月 31 日公布了自己的对齐与安全工作复盘。它标记出超过 10% 的强化学习环境存在损坏或奖励作弊的问题。公司把这些环境的改动冻结了一个月,并把 150 名工程师调去做安全。

为什么重要?模型的习惯就是从这些练习环境里学来的,环境坏了就会教错东西。一家实验室公开清点自己的毛病,并不多见。

✓ 已核实 · 2个来源

WhatsApp X Telegram
在App中阅读——免费,9种语言

相关新闻

OpenAI 的下一个模型用留痕更少的循环思考。
2026-09-03
Perplexity引用了三家网站批量生成的215,128篇导购文章。
2026-09-02
一名开发者花 67 美分,在推理测试上压过不少聊天模型
2026-09-02
最强AI智能体只完成了三成真实实验室工作
2026-08-29
Claude在修补对齐缺陷上胜过人类研究员
2026-08-29