aiminute. ← 全部AI新闻
工具 AI Minute Newsroom 2026-08-23

一个3亿参数的小模型猜大模型接下来会说什么——MacBook 的回答快了2.87倍

一个3亿参数的小模型猜大模型接下来会说什么——MacBook 的回答快了2.87倍

Liquid AI 于8月20日发布 DSpark:一组各约3亿参数的小型草稿模型,与其 LFM2.5 系列一一配对——1.2B Instruct、2.6B 和 8B-A1B。草稿模型一次提出九个候选 token,真正的模型在一次前向传播中校验整块,凡是不认可的一律丢弃。在贪心解码下,输出的文本与大模型单独运行完全一致,因此基准准确率丝毫不变。变的是时间:在 H100 上最高提速3.18倍,在 M4 Max 的 MacBook Pro 上最高2.87倍;2.6B 模型在这台笔记本上超过每秒约140个 token,在多工具测试中平均延迟下降57%。关键在接受率。在 MATH500 上,8B-A1B 的草稿模型每提出10个 token 有8.27个被接受,对应3.18倍;在 GSM8K 上只有4.02个,对应1.29倍——同样的硬件、同样的模型,收益只剩约三分之一。

为什么重要?推测解码是少见的、不附带质量争议的优化:输出可被证明是同一段文本,唯一的问题只是小模型猜对的频率。因此,在相信任何一个卖给你的加速数字之前,值得先弄懂它。厂商说'快3倍',说的是它最好的那种负载;你实际能拿到多少,由你的负载决定,而这里3.18倍与1.29倍之间的距离就是全部的教训。它对在自己机器上跑模型、而非走 API 的人最有意义,因为正是这类改动,能把一个本地模型从'慢到懒得用'变成'快到可以一直开着'。

✓ 已核实 · 2个来源

WhatsApp X Telegram
在App中阅读——免费,9种语言

相关新闻

一个为写代码的智能体、而不是为人建的搜索索引:7000 万份 README、issue 和 PR,试用甚至不需要密钥
2026-08-23
把 AI 接入各种工具的那套标准,当初是按「有个人点同意」来设计的。新版路线图承认:现在发起调用的是机器。
2026-08-23
OpenAI 把 Codex 底下的引擎白送了出去——而它自己的数据说,引擎比模型更值钱
2026-08-22
一个在50毫秒内就开口说话的语音模型,而且服务端代码是开源的
2026-08-22
Anthropic 让自家最强模型去你的代码里找漏洞,但不让你跟它说话
2026-08-22