aiminute. ← Alle KI-News
Forschung AI Minute Newsroom 2026-08-23

Wenn ein kleines Modell das Gespräch an ein großes übergibt, liest das große alles noch einmal. Nvidia sagt, eine Gerade könne die Übersetzung erledigen.

Wenn ein kleines Modell das Gespräch an ein großes übergibt, liest das große alles noch einmal. Nvidia sagt, eine Gerade könne die Übersetzung erledigen.

Systeme, die günstig beginnen und bei schwierigen Fragen auf ein stärkeres Modell hochschalten, zahlen eine versteckte Steuer: Das empfangende Modell liest das gesamte Gespräch von vorn, der Prefill-Schritt, in dem der Großteil der Kosten einer langen Eingabe steckt. In einem arXiv-Papier (2608.03893), das diese Woche breitere Aufmerksamkeit fand, berichten Nvidia-Forscher, dass sich der interne Key-Value-Cache eines Modells derselben Familie per gewöhnlicher linearer Regression auf ein anderes abbilden lässt — ohne Gradientenabstieg gefittet, aus einem Kalibrierungssatz von lediglich 500 Sequenzen à 1.024 Tokens; da die Positionskodierung entfernt wird, gilt der Fit für jede Kontextlänge. Die Übertragung eines Caches mit 32.768 Tokens dauerte 278 Millisekunden gegenüber rund 7 Sekunden für erneutes Prefill, und über sechs Modellpaare in drei Familien lief die Abbildung 2,7- bis 25-mal schneller als das Neulesen. Das Ehrliche steht in den Ergebnissen: Bei vier der sechs Paare blieben 73 bis 98 Prozent der Eigengenauigkeit des empfangenden Modells erhalten, zwei brachen deutlich ein.

Warum es wichtig istEskalation — klein antworten, bei harten Fragen an etwas Großes übergeben — ist die Bauweise fast aller ernsthaften Agentensysteme, und diese Übergabe bedeutet heute, denselben Kontext zweimal zu bezahlen. Ist die Übersetzung zwischen den Arbeitsspeichern zweier Modelle tatsächlich nahezu linear, entfällt die zweite Zahlung weitgehend. Dass zwei von sechs Paaren deutlich scheitern, ist der Grund, dies als Forschungsergebnis und nicht als Produktfunktion zu lesen: Das Verfahren verlangt, dass beide Modelle dieselbe Zahl von Key-Value-Köpfen und dieselbe Dimension je Kopf haben, also dieselbe Familie — dass es herstellerübergreifend funktioniert, hat niemand gezeigt.

✓ Verifiziert · 2 Quellen

WhatsApp X Telegram
In der App lesen — kostenlos, 9 Sprachen

Verwandte Meldungen

Ein Modell mit 27 Milliarden Parametern schlug Opus 4.8 und GPT-5.5 beim Reproduzieren veröffentlichter Arbeiten
2026-08-23
Gib einem Modell das Literaturverzeichnis eines unveröffentlichten Papiers und frage, was darin steht. Die besten treffen in 15 Prozent der Fälle.
2026-08-22
Drei Viertel der Amerikaner wollen kein Rechenzentrum in ihrer Nähe. Vor einem Jahr war das Land noch geteilt.
2026-08-22
Das Modell allein kam auf 30 Prozent. Eingebettet in Nvidias Gerüst löste dasselbe Modell alles.
2026-08-22
Maschinelles Lernen las die Form kranker Hirnzellen — und wählte neun bereits zugelassene Medikamente aus, die sie beruhigten
2026-08-21