Liquid AI 于8月20日发布 DSpark:一组各约3亿参数的小型草稿模型,与其 LFM2.5 系列一一配对——1.2B Instruct、2.6B 和 8B-A1B。草稿模型一次提出九个候选 token,真正的模型在一次前向传播中校验整块,凡是不认可的一律丢弃。在贪心解码下,输出的文本与大模型单独运行完全一致,因此基准准确率丝毫不变。变的是时间:在 H100 上最高提速3.18倍,在 M4 Max 的 MacBook Pro 上最高2.87倍;2.6B 模型在这台笔记本上超过每秒约140个 token,在多工具测试中平均延迟下降57%。关键在接受率。在 MATH500 上,8B-A1B 的草稿模型每提出10个 token 有8.27个被接受,对应3.18倍;在 GSM8K 上只有4.02个,对应1.29倍——同样的硬件、同样的模型,收益只剩约三分之一。