Cloudflare publicó el manual que usa para servir modelos abiertos de gran tamaño como Kimi K2.6 de Moonshot y GLM 5.2 de Z.ai en su plataforma Workers AI. Guardar la caché de atención en 8 bits en lugar de 16 duplica la capacidad de contexto hasta 1,37 millones de tokens y ofrece un 41 % más de rendimiento con un coste por token un 30 % menor; comprimir los pesos de GLM a 4 bits reduce el modelo de 705 GB a 421 GB. Según la compañía, la precisión en los bancos de pruebas fue indistinguible de la de los originales.