aiminute. ← Alle KI-News
Neue Modelle AI Minute Newsroom 2026-08-26

Die Qwen4-Vorschau ist offen: sechs Milliarden Parameter pro Token aktiv — und in Alibabas eigener Tabelle behebt sie mehr echte Bugs als Opus 4.6

Die Qwen4-Vorschau ist offen: sechs Milliarden Parameter pro Token aktiv — und in Alibabas eigener Tabelle behebt sie mehr echte Bugs als Opus 4.6

Alibabas Qwen-Team hat die Gewichte von Qwen3.8-Flash-Next freigegeben, jenem Modell, für das es heute Morgen einen Countdown aufgestellt hatte. Es ist ein multimodales Mixture-of-Experts-System: 125 Milliarden Parameter im Hauptnetz, dazu eine n-Gramm-Embedding-Tabelle mit 51 Milliarden und eine Multi-Token-Prediction-Schicht mit 4 Milliarden — in BF16 insgesamt rund 180 Milliarden, von denen für ein einzelnes Token etwa 6 Milliarden aktiv sind. Die Architektur ist neu: eine Mischung aus Gated DeltaNet und Qwen Sparse Attention, 512 Experten mit zehn gerouteten und einem geteilten, ein Gated Residual und ein Trainingsrezept, das die Optimierer Muon und AdamW kombiniert. Der Kontext beträgt nativ 262.144 Token und lässt sich auf eine Million erweitern. Qwens eigene Tabelle nennt 62,5 auf SWE-bench Pro gegenüber 53,4 für Claude Opus 4.6 Max, 81,0 auf SWE-bench Multilingual gegenüber 77,5 und 58,7 auf DeepSWE 1.1 — Zahlen des Labors, auf dem Prüfstand des Labors, bislang ohne unabhängige Reproduktion. Das Training habe etwa ein Neuntel dessen gekostet, was Qwen3.7-Plus kostete. Die Gewichte liegen unter der Lizenz qwen-community-1.0 auf Hugging Face und ModelScope: 131 Dateien, rund 360 GB, dazu eine FP8-Variante, die den Speicherbedarf halbiert. Qwen bezeichnet das Modell als frühe Vorschau auf die Architektur, auf der Qwen4 aufbauen wird, und kündigt eine gehostete Fassung zu 0,16 Dollar je Million Eingabe-Token und 0,47 Dollar je Million Ausgabe-Token an.

Warum es wichtig istDie entscheidende Zahl ist nicht 62,5, sondern sechs Milliarden. Ein Modell, das pro Token nur sechs Milliarden Parameter zündet, läuft ungefähr so schnell wie ein kleines und trägt dabei das Wissen eines großen — deshalb passt die FP8-Fassung in eine gut ausgestattete Workstation statt in ein Rack. Halten die Coding-Werte unabhängigen Tests stand, schrumpft der Abstand zwischen dem, was man bei einem Spitzenlabor mietet, und dem, was man selbst betreiben kann, erneut — und zwar auf der Achse, die Geld kostet: Token pro Sekunde pro Watt. Der Vorbehalt ist offensichtlich: Es sind die Benchmarks des Herstellers, veröffentlicht am selben Tag wie die Gewichte, und das Erste, was jeder tun sollte, ist sie nachzuprüfen.
#Coding

✓ Verifiziert · 4 Quellen

WhatsApp X Telegram
In der App lesen — kostenlos, 9 Sprachen

Verwandte Meldungen

Das namenlose Modell, das in sechs Tagen 42 Billionen Token verarbeitet hat, hat einen Besitzer: Z.ai bestätigt, dass Ox Alpha ein GLM ist, und öffnet die Gewichte
2026-08-26
Ein Agent, der weiterdenkt, wenn Sie aufhören zu tippen — und das ganze Gerüst passt in weniger als 10.000 Zeilen Bash
2026-08-26
Zeig dem Roboter ein Video einer zehnminütigen Arbeit, und er erledigt die zehnminütige Arbeit — kein Nachtraining, nichts eingetippt
2026-08-26
Alibaba hat einen Countdown auf das erste Stück Qwen4 gesetzt — die Gewichte öffnen heute Nacht um 23:00 Uhr in Peking
2026-08-26
Alibaba hat die Seite eines Modells veröffentlicht, das es Vorschau auf die Qwen4-Architektur nennt — Termin 26. August, die Spezifikationen erschienen und verschwanden wieder
2026-08-25