aiminute. ← 全部AI新闻
研究 AI Minute Newsroom 2026-08-23

小模型把对话交给大模型时,大模型要把一切重读一遍。英伟达说,这个「翻译」也许一条直线就能完成。

小模型把对话交给大模型时,大模型要把一切重读一遍。英伟达说,这个「翻译」也许一条直线就能完成。

先用便宜模型、遇到难题再升级到更强模型的系统,要付一笔隐性代价:接手的模型会把整段对话从头重读一遍,也就是所谓的 prefill 预填充步骤,而长提示词的大部分开销正在于此。在本周获得更广泛关注的一篇 arXiv 论文(2608.03893)中,英伟达研究人员报告说,同一家族中一个模型的内部键值缓存,可以通过普通的线性回归映射到另一个模型上——无需梯度下降,仅用 500 条各 1024 词元的校准序列拟合;剥离位置编码后,该拟合在任意上下文长度下都可复用。转移一个 32768 词元的缓存耗时 278 毫秒,而重新预填充约需 7 秒;在三个家族的六对模型上,映射比重读快 2.7 至 25 倍。诚实的部分在结果里:六对中有四对保留了接收模型自身准确率的 73% 到 98%,另外两对则明显退化。

为什么重要?「先小后大」的升级路径,正是当下大多数正经智能体系统的真实搭法,而今天这一次交接意味着为同一段上下文付两遍钱。如果两个模型工作记忆之间的转换真的接近线性,第二笔钱就基本省掉了。六对中有两对表现很差,正是应把它当作研究结果而非产品特性的理由:该方法要求两个模型的键值头数量和每头维度相同,也就是必须同属一个家族,而跨厂商可行性尚无人证明。

✓ 已核实 · 2个来源

WhatsApp X Telegram
在App中阅读——免费,9种语言

相关新闻

一个270亿参数的模型在复现已发表论文上胜过了Opus 4.8和GPT-5.5
2026-08-23
给模型一篇未发表论文的参考文献列表,问这篇论文讲了什么。最好的模型也只有15%答对。
2026-08-22
四分之三的美国人不想家附近建数据中心。一年前,他们还势均力敌。
2026-08-22
模型单独跑只有 30%。套进英伟达的外壳后,同一个模型全部通关。
2026-08-22
机器学习读懂了患病脑细胞的形态,挑出九种已获批药物让它们平静下来
2026-08-21