aiminute. ← 全部AI新闻
研究 AI Minute Newsroom 2026-09-13

最强编程智能体只完成了真实企业任务的39%

最强编程智能体只完成了真实企业任务的39%

Specific Labs发布了Real-SWE测试,题目来自向真实公司授权取得的私有生产代码。八个前沿模型的完成率在百分之十六点二到百分之三十八点八之间,Claude Fable 5.1排在第一。GPT-6 Astra达到百分之三十三点八,Gemini 3.8 Flash为百分之三十一点二。

为什么重要?你平时看到的跑分,来自整洁的公开代码库,而不是公司里的真实代码。这正是演示效果和你团队每天维护的代码之间的距离。
#编程#AI智能体

✓ 已核实 · 2个来源

WhatsApp X Telegram
在App中阅读——免费,9种语言

相关新闻

Anthropic老板称智能体群一年内或控制整个互联网
2026-09-13
谷歌智能体开发包出现最高危漏洞,任何人都能执行代码
2026-09-12
Salesforce给新智能体起了人名,还给了几周时间
2026-09-12
25位菲尔兹奖得主联署一封信,反对AI刷题
2026-09-12
Kimi便宜的编程模型把百万上下文开放给所有人
2026-09-12