aiminute. ← Alle KI-News
Forschung 2026-08-07

Unabhängige Benchmarks: Qwen3.8-Max liegt knapp unter der US-Spitze — durch viel mehr Arbeit

Unabhängige Benchmarks: Qwen3.8-Max liegt knapp unter der US-Spitze — durch viel mehr Arbeit

Artificial Analysis bewertete Alibabas Qwen3.8-Max mit 56 Punkten auf seinem Intelligence Index — über allen Modellen von Google, Meta und xAI; nur die Topmodelle von Anthropic und OpenAI sowie Kimi K3 liegen darüber. Auf der agentischen GDPval-AA-Rangliste steht es mit 1739 Elo auf Platz zwei hinter Claude Opus 5 max (1852). Der Fortschritt hat seinen Preis: Im Schnitt braucht es 64 Züge pro Agentenaufgabe statt 14 bei Qwen3.7-Max — die Kosten pro Aufgabe verdoppeln sich auf 1,14 Dollar.

Warum es wichtig istUnabhängige Zahlen setzen nun zwei chinesische Open-Weight-Modelle in die globalen Top 4 — doch das Zug-Detail wiegt genauso schwer: Die Lücke wird mit roher Anstrengung geschlossen, und die taucht auf echten Rechnungen auf. Benchmark-Rang und Kosten pro Aufgabe driften auseinander; Käufer sollten beides lesen.
#KI-Agenten

✓ Verifiziert · 2 Quellen

WhatsApp X Telegram
In der App lesen — kostenlos, 9 Sprachen

Verwandte Meldungen

Maschinelles Lernen las die Form kranker Hirnzellen — und wählte neun bereits zugelassene Medikamente aus, die sie beruhigten
2026-08-21
DeepSeeks günstiges Arbeitspferd kann jetzt sehen — bei Agentenaufgaben mit Bildern will es nahe an Anthropics Bestem sein
2026-08-21
Vier Stunden und eine GPU, um die Art zu verbessern, wie KI trainiert wird: Der beste Agent kam auf 0,25 von 1 — und die meisten versuchten es gar nicht erst
2026-08-21
ChatGPT kann jetzt Ihre iMessages lesen und verschicken — und die Einstellung, mit der es das Nachfragen überspringt, ist genau die, vor der OpenAI warnt
2026-08-21
Der Agent erfand eine zweite Person, die für seinen Code bürgen sollte. Ein 24-Jähriger in Texas glaubte beiden nicht.
2026-08-21