研究
AI Minute Newsroom
2026-08-10
谷歌拿一个普通语言模型,教它一次写出256个词——花费不到原始训练成本的十分之一
DiffusionGemma是谷歌DeepMind的一个开放权重实验模型,它不再逐个token地生成文本,而是并行地精修256个token的区块,就像图像扩散模型一次性把整幅画面变清晰那样。每次前向传播产出约二十个token,在单张Nvidia H100上约为每秒1500个输出token。这份署名43人团队、7月31日发布于arXiv的技术报告,提出了一个比速度数字更窄也更有用的主张。扩散式语言模型此前一直被视作必须从零训练的另一条谱系,这正是几乎没人拥有一个的原因。谷歌没有从零训练:它取来Gemma 4——一个总参数252亿、激活参数38亿的专家混合模型——并将其改造:先做监督微调以重建被破坏的文本区块,再进行一个把强化学习与采样器蒸馏结合起来的阶段,全程使用的token不到原模型训练用量的一成。改造后的模型保留了思考模式、多模态输入与长上下文;报告称,即便对手采用最先进的推测解码,它在生成速度上仍胜过自回归模型。权重以Apache 2.0许可置于Hugging Face。不过一旦服务器同时处理约32个并发请求,速度优势就会收窄——而那恰恰是多数生产部署真正所处的区间。
为什么重要?你用过的几乎每一个语言模型都是从左往右工作的,一旦落下某个词就无法回改——写错了开头从句的模型,只能用剩下的半句话去将就它。扩散式解码取消了这道约束:整个区块在你看到之前已被反复写了又改,模型因此能修正自己早先的失误。它之所以一直停留在「有趣但没人做」的状态,原因是成本。没人会把一次前沿训练押在一种可能不划算的架构上。这份报告表明,这一注如今便宜了:你可以把手头已有的模型改造过来,花费不到当初造它的十分之一,这就把实验拉进了任何持有像样开放权重的实验室的射程之内——而这样的实验室为数不少。诚实的边界写在小字里。速度优势在真实服务器负载下会缩水,所以它今天最有意思的地方,是单个用户的延迟才是关键的场景:端侧助手、代码补全,以及任何有人正坐在那儿等着字一个个冒出来的地方。
✓ 已核实 · 2个来源
在App中阅读——免费,9种语言
相关新闻
一个模型没有用训练所有AI的那套方法就学会了写字。
2026-10-06数学家用普通聊天框解决了五个未解难题
2026-10-05没微调过的模型解开了微调版做不出的任务。
2026-10-04用普通照片预训练的模型在推理测试拿到70%
2026-10-04一个花八千美元训练的人工智能打败了西洋陆军棋最强棋手。
2026-10-03