Werkzeuge
AI Minute Newsroom
2026-08-04
Cloudflare zeigt, wie es Billionen-Parameter-Modelle auf weniger GPUs quetscht
Cloudflare hat die Methoden veröffentlicht, mit denen es schwergewichtige offene Modelle wie Moonshots Kimi K2.6 und Z.ais GLM 5.2 auf seiner Workers-AI-Plattform betreibt. Den Attention-Cache in 8 statt 16 Bit zu speichern verdoppelt die Kontextkapazität auf 1,37 Millionen Tokens und bringt 41 % mehr Durchsatz bei rund 30 % geringeren Kosten pro Token; das Komprimieren der GLM-Gewichte auf 4 Bit schrumpft das Modell von 705 GB auf 421 GB. Die Genauigkeit in Benchmark-Suiten sei von den Originalen nicht zu unterscheiden gewesen, so das Unternehmen.
Warum es wichtig istDie Front der KI-Ökonomie sind nicht nur bessere Modelle — sondern dieselben Modelle billiger zu betreiben. Solche Techniken sind ein Hauptgrund, warum schwere offene Modelle immer günstiger laufen, und Cloudflare hat sie offen publiziert, sodass jedes Infrastrukturteam sie kopieren kann.
✓ Verifiziert · 1 Quellen
In der App lesen — kostenlos, 9 Sprachen
Verwandte Meldungen
TikTok steckt einen Einkaufsbot in das Video, das Sie ansehen.
2026-10-06Metas Assistent führt eine Stundenakte über alle Ihre Bekannten.
2026-10-05Ein Befehl holt den von Apple gelöschten KI-Schalter zurück.
2026-10-05OpenAI verspricht täglich eine Neuerung oder setzt Limits zurück.
2026-10-05Meta gab die Firmware frei, damit Sie ein Muse-Gerät bauen.
2026-10-04