aiminute. ← 全部AI新闻
工具 AI Minute Newsroom 2026-08-24

开发者发现“努力度”读数偏低。Anthropic称正在测试服务配置,这个数字本周含义不同。

开发者发现“努力度”读数偏低。Anthropic称正在测试服务配置,这个数字本周含义不同。

8月22日的周末,Claude Code用户发帖称工具的“effort”(努力度)指示器显示出异常低的数值——有截图显示为100分中的10分——并称同样的任务在Opus 5和更早的Opus 4.6之间表现差异极大,某个案例中同一件工作用时43分钟对2分钟。该帖登上了Hacker News首页。Anthropic负责Claude Code团队的Thariq公开回复称,公司目前正在测试API服务配置,在测试期间数值化的努力度被“以不同方式映射”。他表示用户选择的努力度就是实际得到的努力度,公司自己的评估未显示性能下降。帖子的其余部分没那么容易了结:一长串用户描述Opus 5的输出比他们想要的更冗长、更繁复,有些人退回4.6或转向竞品工具。这些是印象而非测量,而关于模型质量的印象出了名的不可靠——但Anthropic确认的那件具体事情是:界面上显示的一个数字,本周的含义与上周不同。

为什么重要?这是一起小事件,却包含关于“按token购买能力”的大教训。你从模型提供商那里租用的不是一件固定的物品:权重可能稳定,但围绕它们的服务配置——量化、路由、努力度映射、上下文处理——在持续调整,而且通常没有发布说明。这次的变动之所以可见,是因为它改变了屏幕上的一个数字;大多数此类变动并不可见。如果你的工作依赖模型行为保持恒定,务实的做法是保留一套自己的小型评估集并定期运行,而不是依赖厂商的仪表盘或者自己“感觉不对劲”。同时请谨慎对待“模型变差了”这类帖子:它们有时是对的,但几乎从来不是证据。
#编程#AI智能体

✓ 已核实 · 2个来源

WhatsApp X Telegram
在App中阅读——免费,9种语言

相关新闻

一个3亿参数的小模型猜大模型接下来会说什么——MacBook 的回答快了2.87倍
2026-08-23
被问到自家「智能体」里有多少能无人值守完成多步任务时,十家公司里有七家答:四分之一或更少
2026-08-23
一个为写代码的智能体、而不是为人建的搜索索引:7000 万份 README、issue 和 PR,试用甚至不需要密钥
2026-08-23
把 AI 接入各种工具的那套标准,当初是按「有个人点同意」来设计的。新版路线图承认:现在发起调用的是机器。
2026-08-23
一个270亿参数的模型在复现已发表论文上胜过了Opus 4.8和GPT-5.5
2026-08-23