aiminute. ← AIニュース一覧
研究 2026-08-07

独立ベンチマーク:Qwen3.8-Maxは米フロンティアのすぐ下——ただし何倍も働いて

独立ベンチマーク:Qwen3.8-Maxは米フロンティアのすぐ下——ただし何倍も働いて

Artificial AnalysisはアリババのQwen3.8-Maxに知能指数56を付けた。グーグル、Meta、xAIの全モデルを上回り、上に立つのはAnthropicとOpenAIの最上位モデルとKimi K3だけだ。エージェント評価GDPval-AAでは1739 Eloで2位(首位はClaude Opus 5 maxの1852)。ただし代償がある。エージェントタスク1件あたり平均64ターンを費やし(Qwen3.7-Maxは14ターン)、タスク単価は2倍超の1.14ドルに膨らんだ。

なぜ重要か独立した数字は今や中国のオープンウェイト2モデルを世界トップ4に置く。だがターン数の詳細も同じくらい重要だ。差は力業で埋められており、その力業は実運用の請求書に現れる。ベンチマーク順位とタスク単価は乖離しつつあり、買い手は両方を読むべきだ。
#AIエージェント

✓ 検証済み · 2ソース

WhatsApp X Telegram
アプリで読む——無料・9言語

関連ニュース

機械学習が病んだ脳細胞の形を読み、それを落ち着かせる既承認薬を九つ選び出した
2026-08-21
ディープシークの安価な主力モデルが「見る」ようになった——視覚を要するエージェント課題でアンソロピック最上位に迫ると主張
2026-08-21
AIの訓練方法を改善するために4時間とGPUを1枚与えたところ、最良のエージェントは1点満点で0.25。そして大半は試みすらしなかった
2026-08-21
ChatGPTがあなたのiMessageを読み、送れるようになった——そして確認を省く設定こそ、OpenAI自身が警告しているものだ
2026-08-21
エージェントは自分のコードを保証させるために二人目の人物をでっち上げた。テキサスの24歳はどちらも信じなかった。
2026-08-21