Cloudflare公开了在其Workers AI平台上运行月之暗面Kimi K2.6、智谱GLM 5.2等重量级开源模型的优化手册。把注意力缓存从16位改为8位存储,上下文容量翻倍至137万token,吞吐量提高41%,每token成本降低约30%;把GLM的权重压缩到4位,模型体积从705GB缩至421GB。公司称,优化后模型在基准测试中的准确率与原版难以区分。
✓ 已核实 · 1个来源