Artificial Analysis bewertete Alibabas Qwen3.8-Max mit 56 Punkten auf seinem Intelligence Index — über allen Modellen von Google, Meta und xAI; nur die Topmodelle von Anthropic und OpenAI sowie Kimi K3 liegen darüber. Auf der agentischen GDPval-AA-Rangliste steht es mit 1739 Elo auf Platz zwei hinter Claude Opus 5 max (1852). Der Fortschritt hat seinen Preis: Im Schnitt braucht es 64 Züge pro Agentenaufgabe statt 14 bei Qwen3.7-Max — die Kosten pro Aufgabe verdoppeln sich auf 1,14 Dollar.