aiminute. ← Alle KI-News
Werkzeuge AI Minute Newsroom 2026-08-04

Cloudflare zeigt, wie es Billionen-Parameter-Modelle auf weniger GPUs quetscht

Cloudflare zeigt, wie es Billionen-Parameter-Modelle auf weniger GPUs quetscht

Cloudflare hat die Methoden veröffentlicht, mit denen es schwergewichtige offene Modelle wie Moonshots Kimi K2.6 und Z.ais GLM 5.2 auf seiner Workers-AI-Plattform betreibt. Den Attention-Cache in 8 statt 16 Bit zu speichern verdoppelt die Kontextkapazität auf 1,37 Millionen Tokens und bringt 41 % mehr Durchsatz bei rund 30 % geringeren Kosten pro Token; das Komprimieren der GLM-Gewichte auf 4 Bit schrumpft das Modell von 705 GB auf 421 GB. Die Genauigkeit in Benchmark-Suiten sei von den Originalen nicht zu unterscheiden gewesen, so das Unternehmen.

Warum es wichtig istDie Front der KI-Ökonomie sind nicht nur bessere Modelle — sondern dieselben Modelle billiger zu betreiben. Solche Techniken sind ein Hauptgrund, warum schwere offene Modelle immer günstiger laufen, und Cloudflare hat sie offen publiziert, sodass jedes Infrastrukturteam sie kopieren kann.

✓ Verifiziert · 1 Quellen

WhatsApp X Telegram
In der App lesen — kostenlos, 9 Sprachen

Verwandte Meldungen

TikTok steckt einen Einkaufsbot in das Video, das Sie ansehen.
2026-10-06
Metas Assistent führt eine Stundenakte über alle Ihre Bekannten.
2026-10-05
Ein Befehl holt den von Apple gelöschten KI-Schalter zurück.
2026-10-05
OpenAI verspricht täglich eine Neuerung oder setzt Limits zurück.
2026-10-05
Meta gab die Firmware frei, damit Sie ein Muse-Gerät bauen.
2026-10-04