aiminute. ← 全部AI新闻
工具 AI Minute Newsroom 2026-08-23

一个3亿参数的小模型猜大模型接下来会说什么——MacBook 的回答快了2.87倍

一个3亿参数的小模型猜大模型接下来会说什么——MacBook 的回答快了2.87倍

Liquid AI 于8月20日发布 DSpark:一组各约3亿参数的小型草稿模型,与其 LFM2.5 系列一一配对——1.2B Instruct、2.6B 和 8B-A1B。草稿模型一次提出九个候选 token,真正的模型在一次前向传播中校验整块,凡是不认可的一律丢弃。在贪心解码下,输出的文本与大模型单独运行完全一致,因此基准准确率丝毫不变。变的是时间:在 H100 上最高提速3.18倍,在 M4 Max 的 MacBook Pro 上最高2.87倍;2.6B 模型在这台笔记本上超过每秒约140个 token,在多工具测试中平均延迟下降57%。关键在接受率。在 MATH500 上,8B-A1B 的草稿模型每提出10个 token 有8.27个被接受,对应3.18倍;在 GSM8K 上只有4.02个,对应1.29倍——同样的硬件、同样的模型,收益只剩约三分之一。

为什么重要?推测解码是少见的、不附带质量争议的优化:输出可被证明是同一段文本,唯一的问题只是小模型猜对的频率。因此,在相信任何一个卖给你的加速数字之前,值得先弄懂它。厂商说'快3倍',说的是它最好的那种负载;你实际能拿到多少,由你的负载决定,而这里3.18倍与1.29倍之间的距离就是全部的教训。它对在自己机器上跑模型、而非走 API 的人最有意义,因为正是这类改动,能把一个本地模型从'慢到懒得用'变成'快到可以一直开着'。

✓ 已核实 · 2个来源

WhatsApp X Telegram
在App中阅读——免费,9种语言

相关新闻

谷歌能把你打的一句话变成一个能玩的游戏。
2026-10-08
ChatGPT现在让模型决定屏幕长什么样,不只是写答案。
2026-10-08
Meta和Sierra为购物智能体提出统一登录规则。
2026-10-07
一个 AI 设计出能跑小模型的开源芯片。
2026-10-07
OpenAI 新接口在 150 毫秒内从固定选项里挑一个。
2026-10-07