aiminute. ← 全部AI新闻
新模型 2026-08-17

一家韩国实验室一代之内把自家模型分数翻了三倍——每百万 token 只收 30 美分

一家韩国实验室一代之内把自家模型分数翻了三倍——每百万 token 只收 30 美分

Upstage 本月发布了 Solar Pro 4。在 Artificial Analysis 的智能指数上它得 42 分,而 Solar Pro 3 为 14 分——这是今年任何实验室单代跃升幅度最大的成绩之一。这让它与 Thinking Machines 的 Inkling 持平,落后 MiMo-V2.5-Pro 一分。提升集中在 Upstage 声称的目标领域:智能体任务。Terminal-Bench v2.1 从 43.2 升至 57,AA-LCR 长文档推理从 62.7 升至 71;在 GDPval-AA v2 智能体基准上,其 Elo 从 498 升至 1277,而人类基线为 1000。定价为每百万输入 token 0.30 美元、每百万输出 token 1.20 美元,缓存命中 0.06 美元,目前打一折,优惠至 9 月 10 日。上下文为 38.4 万 token,输出最多 25.6 万 token,仅支持文本,通过 Upstage API 和 OpenRouter 提供。代价也存在:该模型比前代少用 17% 的输出 token,但每项任务耗时从 6.0 分钟增至 8.6 分钟。它支持英语、韩语和日语。

为什么重要?值得注意的数字不是 42——处在这个位置的模型不少。真正值得注意的是一代之内从 14 到 42,而且来自一家韩国以外大多数人从未评测过的实验室。达到这一档位的配方如今已被充分掌握,中等规模的国家级实验室几个月就能复现,这也是价格底线下滑速度快于前沿推进速度的原因。对超过人类基线的智能体 Elo,应保持面对任何单一基准时应有的谨慎;同时注意延迟:这个分数不只是靠更好的权重换来的,也是靠时间换来的。
#AI智能体

✓ 已核实 · 3个来源

▶ 相关视频: Solar Pro 4 First Look & Test – South Korea's DeepSeek Competitor!
WhatsApp X Telegram
在App中阅读——免费,9种语言

相关新闻

DeepSeek 的廉价主力模型现在能"看"了——在需要视觉的智能体任务上,它自称已接近 Anthropic 最强模型
2026-08-21
给四个小时和一块GPU去改进训练AI的方法:最好的智能体拿到1分中的0.25——而大多数根本没有尝试
2026-08-21
ChatGPT 现在能读你的 iMessage 并替你发送——而那个让它不再询问的开关,正是 OpenAI 自己提醒你注意的
2026-08-21
给机器人演示一次——三到十二秒——它就能在完全不训练的情况下把活儿做对 59 次
2026-08-21
这个智能体凭空造了第二个人来替自己的代码背书。德州一名 24 岁学生两个都不信。
2026-08-21