aiminute. ← AIニュース一覧
新モデル 2026-08-17

韓国の研究所が自社モデルのスコアを一世代で3倍に——100万トークンあたり30セント

韓国の研究所が自社モデルのスコアを一世代で3倍に——100万トークンあたり30セント

Upstage が今月 Solar Pro 4 を公開した。Artificial Analysis の知能指数で 42 点、Solar Pro 3 は 14 点だった——今年どの研究所が記録したものと比べても、一世代での上昇幅として最大級だ。これで Thinking Machines の Inkling と並び、MiMo-V2.5-Pro に 1 点差まで迫った。伸びは Upstage が狙いと述べる領域、すなわちエージェント作業に集中している。Terminal-Bench v2.1 は 43.2 から 57 へ、AA-LCR の長文書推論は 62.7 から 71 へ、GDPval-AA v2 のエージェント指標では Elo が 498 から 1277 へ上がった(人間の基準値は 1000)。価格は入力 100 万トークンあたり 0.30 ドル、出力 100 万トークンあたり 1.20 ドル、キャッシュヒットは 0.06 ドルで、9 月 10 日まで 90% 割引中。コンテキストは 38 万 4000 トークン、出力は最大 25 万 6000 トークン、テキストのみで、Upstage の API と OpenRouter 経由で提供される。代償もある。出力トークンは前世代より 17% 少ないが、1 タスクあたりの所要時間は 6.0 分から 8.6 分に伸びた。対応言語は英語・韓国語・日本語。

なぜ重要か興味深い数字は 42 ではない。そこに並ぶモデルはいくらでもある。興味深いのは、韓国の外ではほとんど誰も評価したことのない研究所が、一世代で 14 から 42 へ跳んだことだ。この水準に到達するレシピは、中規模の国内研究所が数か月で実行できる程度には広く理解されている。価格の底が、フロンティアの前進より速く下がり続けている理由はここにある。人間の基準値を超えたエージェント Elo は、単一のベンチマークに対して払うべき慎重さで受け取りたい。そしてレイテンシにも注目したい。このスコアは、よい重みだけでなく時計の時間でも買われている。
#AIエージェント

✓ 検証済み · 3ソース

▶ 関連動画: Solar Pro 4 First Look & Test – South Korea's DeepSeek Competitor!
WhatsApp X Telegram
アプリで読む——無料・9言語

関連ニュース

ディープシークの安価な主力モデルが「見る」ようになった——視覚を要するエージェント課題でアンソロピック最上位に迫ると主張
2026-08-21
AIの訓練方法を改善するために4時間とGPUを1枚与えたところ、最良のエージェントは1点満点で0.25。そして大半は試みすらしなかった
2026-08-21
ChatGPTがあなたのiMessageを読み、送れるようになった——そして確認を省く設定こそ、OpenAI自身が警告しているものだ
2026-08-21
ロボットに一度見せるだけ——3秒から12秒——訓練なしで100回中59回、仕事をこなす
2026-08-21
エージェントは自分のコードを保証させるために二人目の人物をでっち上げた。テキサスの24歳はどちらも信じなかった。
2026-08-21