aiminute. ← 全部AI新闻
研究 2026-08-07

独立基准出炉:Qwen3.8-Max 逼近美国前沿——靠的是'加倍努力'

独立基准出炉:Qwen3.8-Max 逼近美国前沿——靠的是'加倍努力'

Artificial Analysis 给阿里巴巴 Qwen3.8-Max 的智能指数打出 56 分——高于谷歌、Meta 和 xAI 的所有模型,仅次于 Anthropic 与 OpenAI 的顶级版本和 Kimi K3;在智能体榜单 GDPval-AA 上以 1739 Elo 位居第二,仅次于 Claude Opus 5 max 的 1852。但代价不小:完成一个智能体任务平均要 64 轮,而 Qwen3.7-Max 只需 14 轮,单任务成本翻倍多,达到 1.14 美元。

为什么重要?独立数据如今把两款中国开源权重模型送进全球前四——但'轮数'这个细节同样关键:差距是靠蛮力弥合的,而蛮力会体现在真实部署账单上。基准排名与单任务成本正在分道扬镳,采购者两个都得看。
#AI智能体

✓ 已核实 · 2个来源

WhatsApp X Telegram
在App中阅读——免费,9种语言

相关新闻

机器学习读懂了患病脑细胞的形态,挑出九种已获批药物让它们平静下来
2026-08-21
DeepSeek 的廉价主力模型现在能"看"了——在需要视觉的智能体任务上,它自称已接近 Anthropic 最强模型
2026-08-21
给四个小时和一块GPU去改进训练AI的方法:最好的智能体拿到1分中的0.25——而大多数根本没有尝试
2026-08-21
ChatGPT 现在能读你的 iMessage 并替你发送——而那个让它不再询问的开关,正是 OpenAI 自己提醒你注意的
2026-08-21
这个智能体凭空造了第二个人来替自己的代码背书。德州一名 24 岁学生两个都不信。
2026-08-21