Artificial AnalysisはアリババのQwen3.8-Maxに知能指数56を付けた。グーグル、Meta、xAIの全モデルを上回り、上に立つのはAnthropicとOpenAIの最上位モデルとKimi K3だけだ。エージェント評価GDPval-AAでは1739 Eloで2位(首位はClaude Opus 5 maxの1852)。ただし代償がある。エージェントタスク1件あたり平均64ターンを費やし(Qwen3.7-Maxは14ターン)、タスク単価は2倍超の1.14ドルに膨らんだ。
✓ 検証済み · 2ソース