aiminute. ← 全部AI新闻
研究 2026-08-10

谷歌拿一个普通语言模型,教它一次写出256个词——花费不到原始训练成本的十分之一

谷歌拿一个普通语言模型,教它一次写出256个词——花费不到原始训练成本的十分之一

DiffusionGemma是谷歌DeepMind的一个开放权重实验模型,它不再逐个token地生成文本,而是并行地精修256个token的区块,就像图像扩散模型一次性把整幅画面变清晰那样。每次前向传播产出约二十个token,在单张Nvidia H100上约为每秒1500个输出token。这份署名43人团队、7月31日发布于arXiv的技术报告,提出了一个比速度数字更窄也更有用的主张。扩散式语言模型此前一直被视作必须从零训练的另一条谱系,这正是几乎没人拥有一个的原因。谷歌没有从零训练:它取来Gemma 4——一个总参数252亿、激活参数38亿的专家混合模型——并将其改造:先做监督微调以重建被破坏的文本区块,再进行一个把强化学习与采样器蒸馏结合起来的阶段,全程使用的token不到原模型训练用量的一成。改造后的模型保留了思考模式、多模态输入与长上下文;报告称,即便对手采用最先进的推测解码,它在生成速度上仍胜过自回归模型。权重以Apache 2.0许可置于Hugging Face。不过一旦服务器同时处理约32个并发请求,速度优势就会收窄——而那恰恰是多数生产部署真正所处的区间。

为什么重要?你用过的几乎每一个语言模型都是从左往右工作的,一旦落下某个词就无法回改——写错了开头从句的模型,只能用剩下的半句话去将就它。扩散式解码取消了这道约束:整个区块在你看到之前已被反复写了又改,模型因此能修正自己早先的失误。它之所以一直停留在「有趣但没人做」的状态,原因是成本。没人会把一次前沿训练押在一种可能不划算的架构上。这份报告表明,这一注如今便宜了:你可以把手头已有的模型改造过来,花费不到当初造它的十分之一,这就把实验拉进了任何持有像样开放权重的实验室的射程之内——而这样的实验室为数不少。诚实的边界写在小字里。速度优势在真实服务器负载下会缩水,所以它今天最有意思的地方,是单个用户的延迟才是关键的场景:端侧助手、代码补全,以及任何有人正坐在那儿等着字一个个冒出来的地方。

✓ 已核实 · 2个来源

WhatsApp X Telegram
在App中阅读——免费,9种语言

相关新闻

机器学习读懂了患病脑细胞的形态,挑出九种已获批药物让它们平静下来
2026-08-21
给四个小时和一块GPU去改进训练AI的方法:最好的智能体拿到1分中的0.25——而大多数根本没有尝试
2026-08-21
这个智能体凭空造了第二个人来替自己的代码背书。德州一名 24 岁学生两个都不信。
2026-08-21
皮尤把五十万个网页送进检测器:ChatGPT 问世后发布的网页中,三分之一带有 AI 痕迹
2026-08-21
美国食品药品监督管理局已批准 1357 款人工智能医疗器械。其中只有三款检验过患者是否活得更久或更好。
2026-08-20