aiminute. ← Toute l’actu IA
Outils AI Minute Newsroom 2026-08-04

Cloudflare explique comment il fait tenir des modèles ouverts géants sur moins de GPU

Cloudflare explique comment il fait tenir des modèles ouverts géants sur moins de GPU

Cloudflare a publié les recettes qu'il utilise pour servir des modèles ouverts poids lourds comme Kimi K2.6 de Moonshot et GLM 5.2 de Z.ai sur sa plateforme Workers AI. Stocker le cache d'attention en 8 bits au lieu de 16 double la capacité de contexte à 1,37 million de jetons et augmente le débit de 41 % pour un coût par jeton réduit d'environ 30 % ; compresser les poids de GLM en 4 bits fait passer le modèle de 705 Go à 421 Go. La précision sur les suites de référence est restée indiscernable des originaux, selon l'entreprise.

Pourquoi c'est importantLa frontière de l'économie de l'IA, ce ne sont pas seulement de meilleurs modèles : c'est servir les mêmes modèles moins cher. Ces techniques expliquent en grande partie pourquoi les grands modèles ouverts coûtent de moins en moins cher à exploiter — et Cloudflare les a publiées ouvertement, à la disposition de toute équipe d'infrastructure.

✓ Vérifié · 1 sources

WhatsApp X Telegram
Lire dans l'app — gratuit, en 9 langues

Actus liées

TikTok a glissé un chatbot d'achat dans la vidéo que vous regardez.
2026-10-06
L'assistant de Meta tient une fiche horaire sur vos proches.
2026-10-05
Une commande rend l'interrupteur d'IA qu'Apple avait supprimé.
2026-10-05
OpenAI promet une amélioration par jour sinon il remet vos quotas.
2026-10-05
Meta a ouvert le firmware pour fabriquer votre propre appareil Muse.
2026-10-04