先用便宜模型、遇到难题再升级到更强模型的系统,要付一笔隐性代价:接手的模型会把整段对话从头重读一遍,也就是所谓的 prefill 预填充步骤,而长提示词的大部分开销正在于此。在本周获得更广泛关注的一篇 arXiv 论文(2608.03893)中,英伟达研究人员报告说,同一家族中一个模型的内部键值缓存,可以通过普通的线性回归映射到另一个模型上——无需梯度下降,仅用 500 条各 1024 词元的校准序列拟合;剥离位置编码后,该拟合在任意上下文长度下都可复用。转移一个 32768 词元的缓存耗时 278 毫秒,而重新预填充约需 7 秒;在三个家族的六对模型上,映射比重读快 2.7 至 25 倍。诚实的部分在结果里:六对中有四对保留了接收模型自身准确率的 73% 到 98%,另外两对则明显退化。