DiffusionGemma是谷歌DeepMind的一个开放权重实验模型,它不再逐个token地生成文本,而是并行地精修256个token的区块,就像图像扩散模型一次性把整幅画面变清晰那样。每次前向传播产出约二十个token,在单张Nvidia H100上约为每秒1500个输出token。这份署名43人团队、7月31日发布于arXiv的技术报告,提出了一个比速度数字更窄也更有用的主张。扩散式语言模型此前一直被视作必须从零训练的另一条谱系,这正是几乎没人拥有一个的原因。谷歌没有从零训练:它取来Gemma 4——一个总参数252亿、激活参数38亿的专家混合模型——并将其改造:先做监督微调以重建被破坏的文本区块,再进行一个把强化学习与采样器蒸馏结合起来的阶段,全程使用的token不到原模型训练用量的一成。改造后的模型保留了思考模式、多模态输入与长上下文;报告称,即便对手采用最先进的推测解码,它在生成速度上仍胜过自回归模型。权重以Apache 2.0许可置于Hugging Face。不过一旦服务器同时处理约32个并发请求,速度优势就会收窄——而那恰恰是多数生产部署真正所处的区间。