aiminute. ← Alle KI-News
Forschung 2026-08-10

Google nahm ein gewöhnliches Sprachmodell und brachte ihm bei, 256 Wörter auf einmal zu schreiben — für weniger als ein Zehntel der ursprünglichen Trainingskosten

Google nahm ein gewöhnliches Sprachmodell und brachte ihm bei, 256 Wörter auf einmal zu schreiben — für weniger als ein Zehntel der ursprünglichen Trainingskosten

DiffusionGemma ist ein experimentelles Modell mit offenen Gewichten von Google DeepMind, das Text nicht Token für Token erzeugt. Es verfeinert Blöcke von 256 Token parallel, so wie ein Bild-Diffusionsmodell das ganze Bild auf einmal schärft, mit etwa zwanzig Token je Vorwärtsdurchlauf und rund 1.500 Ausgabetoken pro Sekunde auf einer einzelnen Nvidia H100. Der technische Bericht, einem 43-köpfigen Team zugeschrieben und am 31. Juli auf arXiv eingestellt, erhebt eine engere und nützlichere Behauptung als die Geschwindigkeitszahl. Diffusions-Sprachmodelle galten bislang als eigene Linie, die von Grund auf trainiert werden muss — deshalb hat fast niemand eines. Google trainierte nicht von Grund auf: Es nahm Gemma 4, ein Mixture-of-Experts-Modell mit 25,2 Milliarden Gesamt- und 3,8 Milliarden aktiven Parametern, und wandelte es um — zuerst überwachtes Feintuning zum Rekonstruieren beschädigter Textblöcke, dann eine Stufe, die bestärkendes Lernen und Sampler-Destillation verbindet — mit weniger als zehn Prozent der Token, mit denen das Ausgangsmodell trainiert wurde. Das umgewandelte Modell behält Denkmodus, multimodale Eingabe und langen Kontext, und dem Bericht zufolge schlägt es autoregressive Modelle in der Erzeugungsgeschwindigkeit selbst dann, wenn diese modernste spekulative Dekodierung verwenden. Die Gewichte liegen unter Apache 2.0 auf Hugging Face. Der Geschwindigkeitsvorsprung schrumpft, sobald ein Server rund 32 gleichzeitige Anfragen bedient — genau das Regime, in dem die meisten Produktivsysteme tatsächlich leben.

Warum es wichtig istNahezu jedes Sprachmodell, das Sie benutzt haben, arbeitet von links nach rechts und kann ein Wort nicht mehr überarbeiten, sobald es gesetzt ist: Das Modell, das einen falschen Anfangssatz geschrieben hat, muss den Rest des Satzes damit leben. Diffusionsdekodierung hebt diese Fessel auf — der Block wird geschrieben und umgeschrieben, bevor Sie etwas davon sehen, sodass das Modell eigene frühe Fehler beheben kann. Dass die Sache eine Kuriosität blieb, lag am Preis. Niemand verwendet einen Spitzentrainingslauf auf eine Architektur, die sich womöglich nicht auszahlt. Dieser Bericht zeigt: Die Wette ist jetzt billig. Man kann ein Modell, das man ohnehin hat, für weniger als ein Zehntel seiner Bauzahlen umwandeln, womit das Experiment in Reichweite jedes Labors mit brauchbaren offenen Gewichten rückt — und davon gibt es viele. Die redliche Grenze steht im Kleingedruckten. Unter echter Serverlast schwindet der Geschwindigkeitsvorteil; am interessantesten ist die Sache heute also dort, wo die Latenz eines einzelnen Nutzers zählt: Assistenten auf dem Gerät, Code-Vervollständigung, überall dort, wo ein Mensch dasitzt und darauf wartet, dass die Wörter erscheinen.

✓ Verifiziert · 2 Quellen

WhatsApp X Telegram
In der App lesen — kostenlos, 9 Sprachen

Verwandte Meldungen

Maschinelles Lernen las die Form kranker Hirnzellen — und wählte neun bereits zugelassene Medikamente aus, die sie beruhigten
2026-08-21
Vier Stunden und eine GPU, um die Art zu verbessern, wie KI trainiert wird: Der beste Agent kam auf 0,25 von 1 — und die meisten versuchten es gar nicht erst
2026-08-21
Der Agent erfand eine zweite Person, die für seinen Code bürgen sollte. Ein 24-Jähriger in Texas glaubte beiden nicht.
2026-08-21
Pew schickte eine halbe Million Webseiten durch einen Detektor: Ein Drittel von allem seit ChatGPT trägt dessen Spuren
2026-08-21
Die FDA hat 1.357 KI-Medizinprodukte zugelassen. Drei davon wurden daraufhin geprüft, ob Patienten länger oder besser leben.
2026-08-20