Z.ai于8月26日发布GLM-5.3-Flash,并确认这就是此前以Ox Alpha代号匿名流传的模型。它是一个混合专家模型,总参数3200亿、每token激活180亿,上下文窗口100万token,权重以MIT许可发布在Hugging Face上;并且是GLM-5系列首个原生多模态模型——图像与视频由基座模型直接处理,而非外挂。架构上以线性注意力处理局部依赖、稀疏注意力处理长程上下文;在满上下文长度下,一个名为IndexPool的组件会压缩索引器键向量,以免延迟和显存开销失控。Z.ai称训练语料约为30万亿token的多模态数据。按其自报数据,模型在DeepSWE v1.1上得63.4(GLM-5.2为46.2),AutomationBench上48.8(对26.2),Terminal-Bench 2.1上84.3,紧邻Claude Opus 4.8的85.0。定价为每百万输入token 0.15美元、缓存0.03美元、输出0.50美元,约为GLM-5.2的十分之一;9月9日前还有五折促销。最会引发争论的是这条说法:Z.ai称整个Ox Alpha预览完全由国产加速器承载,使用自研推理引擎,在数万张加速器规模上取得约三倍的端到端提升。所有基准数字均为自报,尚未经独立复现。