aiminute. ← AIニュース一覧
研究 AI Minute Newsroom 2026-08-07

独立ベンチマーク:Qwen3.8-Maxは米フロンティアのすぐ下——ただし何倍も働いて

独立ベンチマーク:Qwen3.8-Maxは米フロンティアのすぐ下——ただし何倍も働いて

Artificial AnalysisはアリババのQwen3.8-Maxに知能指数56を付けた。グーグル、Meta、xAIの全モデルを上回り、上に立つのはAnthropicとOpenAIの最上位モデルとKimi K3だけだ。エージェント評価GDPval-AAでは1739 Eloで2位(首位はClaude Opus 5 maxの1852)。ただし代償がある。エージェントタスク1件あたり平均64ターンを費やし(Qwen3.7-Maxは14ターン)、タスク単価は2倍超の1.14ドルに膨らんだ。

なぜ重要か独立した数字は今や中国のオープンウェイト2モデルを世界トップ4に置く。だがターン数の詳細も同じくらい重要だ。差は力業で埋められており、その力業は実運用の請求書に現れる。ベンチマーク順位とタスク単価は乖離しつつあり、買い手は両方を読むべきだ。
#AIエージェント

✓ 検証済み · 2ソース

WhatsApp X Telegram
アプリで読む——無料・9言語

関連ニュース

同じ仕事を二十回やらせると最高の人工知能の点が三分の一落ちた。
2026-10-06
すべてのAIを訓練する方法を使わずに、モデルが学びました。
2026-10-06
TikTokが見ている動画の中に買い物ボットを入れました。
2026-10-06
ウィキメディアがOpenAIのエージェントを5月の障害で疑っています。
2026-10-06
メタの助手はあなたの周りの全員を一時間ごとに記録しています。
2026-10-05