Cloudflareは、MoonshotのKimi K2.6やZ.aiのGLM 5.2といった重量級オープンモデルをWorkers AIプラットフォームで動かすための最適化手法を公開した。アテンションキャッシュを16ビットではなく8ビットで保存するとコンテキスト容量は2倍の137万トークンになり、トークン当たりコストを約30%下げつつスループットを41%高められる。GLMの重みを4ビットに圧縮すればモデルは705GBから421GBに縮む。ベンチマークでの精度はオリジナルと見分けがつかなかったという。