Cloudflare; Moonshot'ın Kimi K2.6'sı ve Z.ai'ın GLM 5.2'si gibi ağır sıklet açık modelleri Workers AI platformunda sunarken kullandığı yöntemleri yayımladı. Dikkat önbelleğini 16 bit yerine 8 bit saklamak bağlam kapasitesini iki katına, 1,37 milyon jetona çıkarıyor ve jeton başına kabaca %30 daha düşük maliyetle %41 daha yüksek işlem hacmi sağlıyor; GLM'in ağırlıklarını 4 bite sıkıştırmak ise modeli 705 GB'tan 421 GB'a küçültüyor. Şirkete göre karşılaştırma testlerindeki doğruluk, orijinallerden ayırt edilemedi.