aiminute. ← 全部AI新闻
研究 AI Minute Newsroom 2026-08-23

小模型把对话交给大模型时,大模型要把一切重读一遍。英伟达说,这个「翻译」也许一条直线就能完成。

小模型把对话交给大模型时,大模型要把一切重读一遍。英伟达说,这个「翻译」也许一条直线就能完成。

先用便宜模型、遇到难题再升级到更强模型的系统,要付一笔隐性代价:接手的模型会把整段对话从头重读一遍,也就是所谓的 prefill 预填充步骤,而长提示词的大部分开销正在于此。在本周获得更广泛关注的一篇 arXiv 论文(2608.03893)中,英伟达研究人员报告说,同一家族中一个模型的内部键值缓存,可以通过普通的线性回归映射到另一个模型上——无需梯度下降,仅用 500 条各 1024 词元的校准序列拟合;剥离位置编码后,该拟合在任意上下文长度下都可复用。转移一个 32768 词元的缓存耗时 278 毫秒,而重新预填充约需 7 秒;在三个家族的六对模型上,映射比重读快 2.7 至 25 倍。诚实的部分在结果里:六对中有四对保留了接收模型自身准确率的 73% 到 98%,另外两对则明显退化。

为什么重要?「先小后大」的升级路径,正是当下大多数正经智能体系统的真实搭法,而今天这一次交接意味着为同一段上下文付两遍钱。如果两个模型工作记忆之间的转换真的接近线性,第二笔钱就基本省掉了。六对中有两对表现很差,正是应把它当作研究结果而非产品特性的理由:该方法要求两个模型的键值头数量和每头维度相同,也就是必须同属一个家族,而跨厂商可行性尚无人证明。

✓ 已核实 · 2个来源

WhatsApp X Telegram
在App中阅读——免费,9种语言

相关新闻

OpenAI一次提问得出722篇数学论文。
2026-10-07
埃尔德什问题网站停止接收新的证明。
2026-10-07
同一个任务跑二十遍,最好的智能体分数掉了三分之一。
2026-10-06
一个模型没有用训练所有AI的那套方法就学会了写字。
2026-10-06
数学家用普通聊天框解决了五个未解难题
2026-10-05