aiminute. ← Toute l’actu IA
Outils 2026-08-04

Cloudflare explique comment il fait tenir des modèles ouverts géants sur moins de GPU

Cloudflare explique comment il fait tenir des modèles ouverts géants sur moins de GPU

Cloudflare a publié les recettes qu'il utilise pour servir des modèles ouverts poids lourds comme Kimi K2.6 de Moonshot et GLM 5.2 de Z.ai sur sa plateforme Workers AI. Stocker le cache d'attention en 8 bits au lieu de 16 double la capacité de contexte à 1,37 million de jetons et augmente le débit de 41 % pour un coût par jeton réduit d'environ 30 % ; compresser les poids de GLM en 4 bits fait passer le modèle de 705 Go à 421 Go. La précision sur les suites de référence est restée indiscernable des originaux, selon l'entreprise.

Pourquoi c'est importantLa frontière de l'économie de l'IA, ce ne sont pas seulement de meilleurs modèles : c'est servir les mêmes modèles moins cher. Ces techniques expliquent en grande partie pourquoi les grands modèles ouverts coûtent de moins en moins cher à exploiter — et Cloudflare les a publiées ouvertement, à la disposition de toute équipe d'infrastructure.

✓ Vérifié · 1 sources

WhatsApp X Telegram
Lire dans l'app — gratuit, en 9 langues

Actus liées

Apple Music indiquera quand un morceau a été fait par une machine — mais c'est celui qui le publie qui décide de le dire
2026-08-21
Stripe vient de payer 7,5 milliards pour un routeur de modèles. Quelques jours plus tard, Ramp en construit un et l'offre jusqu'en janvier.
2026-08-21
L'assistant de Meta est désormais une app Mac qui lit votre écran et écrit dans n'importe quelle fenêtre — et ce qu'il voit peut entraîner le modèle
2026-08-21
Un clic sur un site d'information dit désormais à Google de vous en montrer davantage — et vous restez sur la page que vous lisiez
2026-08-21
Adobe génère désormais la musique, la voix off et le claquement de porte — et affirme que la licence vous couvre
2026-08-21