Cloudflare a publié les recettes qu'il utilise pour servir des modèles ouverts poids lourds comme Kimi K2.6 de Moonshot et GLM 5.2 de Z.ai sur sa plateforme Workers AI. Stocker le cache d'attention en 8 bits au lieu de 16 double la capacité de contexte à 1,37 million de jetons et augmente le débit de 41 % pour un coût par jeton réduit d'environ 30 % ; compresser les poids de GLM en 4 bits fait passer le modèle de 705 Go à 421 Go. La précision sur les suites de référence est restée indiscernable des originaux, selon l'entreprise.