Werkzeuge
2026-08-04
Cloudflare zeigt, wie es Billionen-Parameter-Modelle auf weniger GPUs quetscht
Cloudflare hat die Methoden veröffentlicht, mit denen es schwergewichtige offene Modelle wie Moonshots Kimi K2.6 und Z.ais GLM 5.2 auf seiner Workers-AI-Plattform betreibt. Den Attention-Cache in 8 statt 16 Bit zu speichern verdoppelt die Kontextkapazität auf 1,37 Millionen Tokens und bringt 41 % mehr Durchsatz bei rund 30 % geringeren Kosten pro Token; das Komprimieren der GLM-Gewichte auf 4 Bit schrumpft das Modell von 705 GB auf 421 GB. Die Genauigkeit in Benchmark-Suiten sei von den Originalen nicht zu unterscheiden gewesen, so das Unternehmen.
Warum es wichtig istDie Front der KI-Ökonomie sind nicht nur bessere Modelle — sondern dieselben Modelle billiger zu betreiben. Solche Techniken sind ein Hauptgrund, warum schwere offene Modelle immer günstiger laufen, und Cloudflare hat sie offen publiziert, sodass jedes Infrastrukturteam sie kopieren kann.
✓ Verifiziert · 1 Quellen
In der App lesen — kostenlos, 9 Sprachen
Verwandte Meldungen
Apple Music zeigt künftig an, wenn ein Song von einer Maschine stammt — ob das jemand angibt, entscheidet der Uploader
2026-08-21Stripe hat gerade 7,5 Milliarden Dollar für einen Modell-Router gezahlt. Tage später baut Ramp einen und verschenkt ihn bis Januar.
2026-08-21Metas Assistent ist jetzt eine Mac-App, die Ihren Bildschirm liest und in jedes Fenster tippt — und was sie sieht, kann das Modell trainieren
2026-08-21Ein Klick auf einer Nachrichtenseite sagt Google jetzt, dass Sie mehr davon sehen wollen — und Sie bleiben auf der Seite, die Sie gerade lesen
2026-08-21Adobe erzeugt jetzt die Musik, die Sprecherstimme und das zuschlagende Türgeräusch — und sagt, die Lizenz decke Sie ab
2026-08-21