JOTO
Contact us
← AI 智库
技术前沿

英伟达提出跨模型KV缓存迁移技术:用线性数学替代昂贵模型切换

2026 年 8 月 21 日

英伟达研究发现,不同规模大语言模型间的KV缓存可经简单线性映射高效迁移,避免重复预填充。实验显示速度提升2.7–25倍,准确率保留73%–98%,显著降低多模型智能体工作流的计算成本与延迟。

Nvidia finds that simple linear math can replace costly AI model handoffs

当一个具身智能(agentic)AI系统将任务从一个小模型移交至一个更大的模型——或再次降级回小模型时,它需付出高昂代价:接收模型必须从头开始重新计算整个对话,从而推高计算成本和延迟。这是企业构建长周期、多大语言模型(multi-LLM)工作流时面临的主要瓶颈。

为解决这一挑战,英伟达(Nvidia)的研究人员提出了一种 跨模型KV缓存迁移(cross-model KV cache transfer) 技术,该技术可直接将源模型预填充(prefilled)的KV缓存映射到目标模型中。该技术契合现实世界中具身智能应用的场景,即在多轮交互中上下文持续累积。 

对于现实世界的AI应用,跨模型KV缓存迁移可在长时间运行、多大语言模型工作流中降低计算成本与延迟——且仅依赖简单的线性数学运算,无需耗费大量资源的深度学习模型。

实验表明,在兼容的模型对上,该线性映射过程的运行速度比重新计算对话快2.7至25倍,同时保留目标模型独立运行时高达98%的准确率。 

为何在会话中途切换模型如此昂贵

考察大语言模型(LLM)如何处理内存,有助于理解多模型工作流为何在生产环境中遭遇性能瓶颈。当一个LLM接收到提示(prompt)时,首先必须执行‘预填充’(prefill)阶段,即初始前向传播过程,该过程为所有输入词元(tokens)计算键(keys)和值(values),并填充键值(KV)缓存。 

此后,模型进入‘解码’(decode)阶段,在此阶段中逐个计算并生成序列中的下一个词元。在此阶段,模型从该KV缓存中读取数据以逐个预测新词元,从而避免为每个新词元重新评估整个对话历史。

在多轮对话或长周期具身智能会话中,上下文逐步变长。由于预填充阶段的计算成本随模型规模和输入长度同步增长,若KV缓存失效,处理这些长会话将变得日益昂贵,并引入显著延迟。

每当AI系统尝试在会话中途切换模型时(例如,将复杂推理步骤路由至更大模型,或为节省成本降级至更小模型),就会发生这种缓存失效。由于不同LLM具有不同架构,它们对缓存输入的格式要求也各不相同。 

因此,任何模型切换都会迫使接收模型从头支付全部预填充成本,以重新为已累积的上下文计算KV缓存。 

在不从头开始的前提下实现模型间内存映射

英伟达研究人员研究了跨模型KV缓存迁移,旨在探索开发者如何在不重复执行预填充阶段的前提下,将一个模型的KV缓存转换为另一模型所期望的格式。 

若该问题得以解决,跨模型KV缓存迁移将在两个方向上均带来益处。从小模型到大模型的迁移可提升输出质量。例如,一个廉价的小模型可处理具身智能工作流中的常规部分,但在面对复杂推理问题时力不从心;此时可将KV缓存映射至一个更大的模型,并无缝延续后续流程。

另一方面,从大模型到小模型的迁移可降低计算成本。一个能力极强的大模型可能被用于在会话初始阶段解析海量复杂系统提示(system prompt)或合成一份密集型PDF文档。一旦繁重任务完成,会话的KV缓存即可向下映射至一个更小、更经济的模型,以处理后续高频、快速的对话轮次。

此前已有若干尝试解决KV缓存迁移问题的努力,但它们存在若干关键局限,包括需要耗费大量资源的基于梯度的训练,或对架构施加极为严格的约束条件。

cross-model kv cache transfer

跨模型KV缓存迁移(来源:arXiv)

在本次初步研究中,作者将其关注范围限定于同族模型间的迁移,例如在Qwen、Llama或Ministral家族内不同尺寸模型之间的迁移。这些模型共享分词器(tokenizers)、训练数据‘基因’(DNA)及核心架构风格,但规模与深度各异。然而,该框架为未来实验留下了广阔空间。研究人员指出,该技术最终或可扩展至跨族迁移、KV头数量不匹配,或融合标准注意力机制与其他记忆机制的混合架构。

英伟达此项研究的关键发现是:跨模型KV缓存本质上是一种高度线性的结构。这意味着可通过简单的代数技巧完成映射,而无需依赖繁重的神经网络训练。例如,在实验将140亿参数Qwen3模型的KV缓存迁移至320亿参数版本时,作者发现,仅用一个简单线性回归映射将某一层源模型映射至对应目标层,即可恢复目标模型键(keys)中56%的方差及值(values)中32%的方差;当组合多个源层时,这两项数值分别升至79%和65%。

英伟达提出跨模型KV缓存迁移技术:用线性数学替代昂贵模型切换 配图 3

英伟达三层KV缓存迁移解决方案(来源:arXiv)

为将该线性关系转化为实用系统,研究人员设计了一种闭式(closed-form)、按注意力头(per-head)的岭回归(ridge)映射器,其包含三个关键组件:

  • 按注意力头岭回归(Per-head ridge regression): 研究人员未采用复杂的深度学习来训练该系统,而是使用仅含数百条文本序列的微小校准集拟合一个简单线性回归。该技术针对每个注意力头独立求解经典的最优拟合直线问题。

  • 跨层源层选择(Cross-layer source selection): 由于源模型与目标模型的层数不同,该映射器会对每个特定目标层评估并选取最具预测力的源层作为输入。借此方式,系统仅从旧模型中选取最有助益的记忆片段,以构建新模型所需的记忆。

  • 内容空间映射(Content-space mapping): 在转换数据之前,该映射器先剥离旋转位置编码(RoPE)。RoPE(Rotary Position Embedding)是一种标准机制,通过对数据施加一种依赖位置的数学旋转,使模型理解序列中词元的顺序。剥离RoPE编码后,映射器即可泛化至长度超过其训练数据的序列。

对线性映射器进行实测

为验证该技术是否有效,研究人员在六个‘KV匹配’(matched-KV)模型家族上评估了该迁移流水线。‘KV匹配’指源模型与目标模型具有相同的KV头数量及每头维度,这在同一家族内不同尺寸模型中属典型情况。

所涉模型家族包括Qwen3、Llama 3.1和Ministral 3,测试涵盖从30亿至700亿参数的不同尺寸模型间的KV缓存迁移。其实验包含一次巨大的参数量跃迁——从Llama 3.1 8B至70B,参数量扩大8.8倍。

为覆盖广泛的任务,他们评估了模型在五个核心准确率基准测试(ARC-Challenge、HellaSwag、WinoGrande、MMLU 和 GSM8K)上的表现,以及在 WikiText-2 上的语言建模困惑度(perplexity),还评估了一个名为 CoQA 的多轮对话任务。为拟合线性翻译映射器(linear translation mapper),他们使用了一个极小的校准数据集,仅包含 500 个文本序列,每个序列长度为 1,024 个 token。

研究人员将该框架与基线天花板准确率(baseline ceiling accuracy)进行比较,该基线定义为目标模型执行完整、传统预填充(prefill)时所达到的准确率。他们还将整个系统与若干消融配置(ablated configurations)进行对比,例如减少所选层数或停用不同组件。此外,他们还将这种简单方法与一个通过反向传播(backpropagation)训练的深度神经网络进行对比,以检验更复杂的深度学习方法能否在线性方法表现欠佳的模型对上恢复准确率。

在所测试的六组模型对中,快速、闭式解(closed-form)线性岭回归映射器(linear ridge mapper)保留了目标模型独立预填充准确率的 73% 至 98%——其中包括从 Llama 3.1 8B 到 70B 的巨大跨越,该迁移保留了目标模型 72.8% 的准确率。

该映射器的运行速度也比重新执行预填充快 2.7 至 25 倍。例如,将 Qwen3 14B 模型生成的 32,768-token KV 缓存迁移到 32B 模型时,迁移耗时仅为 278 毫秒,而标准的重新预填充则需近 7 秒。

该系统在跨多个步骤运行的任务中也展现出高度稳定性。在多轮对话测试中,目标基线与迁移后缓存之间的漂移(drift),即准确率损失,在全部 10 轮对话中均保持极小,证明其在长时间智能体(agentic)会话中不会发生级联失效。

然而,这种直接的线性方法在特定模型对上确实遇到了局限性。在两个 Ministral 配置中,线性映射器性能急剧下降,原因是简单的线性拟合无法在校准数据范围之外进行外推。为解决此问题,研究人员将线性映射器替换为一个非线性多层感知机(MLP),该 MLP 具有两个各含 1,024 个单元的隐藏层,并在相同数据上完成训练。此举为系统增加了复杂性和训练开销,但使其准确率恢复至 90% 以上。

一个比单篇论文所能解决的更大行业问题

跨模型迁移(cross-model transfer)的引入,是整个行业为解决 KV 缓存瓶颈(KV cache bottleneck)所作广泛努力的一部分;该瓶颈已成为企业级 AI 扩展过程中的关键障碍之一。随着开发者推动大语言模型(LLM)处理海量文档或代码库,并执行长时间运行的推理任务,管理这一内存层的重要性已不亚于模型本身。

在过去一年中,研究人员已从多个角度应对这一计算与内存难题。例如,英伟达(Nvidia)近期推出了 动态内存稀疏化(dynamic memory sparsification) (DMS),这是一种智能地从 KV 缓存中剔除较不重要 token 的技术,可将推理成本最多降低 8 倍。 

其他方法则聚焦于激进的数据压缩。麻省理工学院(MIT)研究人员开发了一种名为 注意力匹配(Attention Matching) 的代数压缩技术,可在不降低质量的前提下将 KV 缓存压缩 50 倍。类似地,英伟达推出了 KV 缓存变换编码(KV Cache Transform Coding) (KVTC),该技术借鉴媒体压缩理念,在不更改底层模型权重的前提下将内存占用缩减 20 倍。

除压缩之外,研究人员也在攻克内存检索的计算开销问题。例如优化器 IndexCache 通过剥离冗余的层计算,显著缩短长上下文应用中的首 token 延迟(time-to-first-token)。而 DeepSeek 和 GLM 系列等模型则正通过架构创新来优化 KV 缓存。

随着 AI 系统承担起更长视野(longer-horizon)任务及更复杂架构,其底层内存基础设施的重要性正日益接近模型本身。跨模型 KV 缓存迁移为开发者提供了又一工具,使其在扩展多模型智能体系统时得以持续压低推理成本。

JOTO 企业落地观察

  • 对企业部署而言,该技术使企业可在不牺牲响应质量前提下,动态混合使用大小模型——例如用小模型处理高频对话、大模型专注复杂推理,从而在GPU资源有限时仍保障长周期任务的经济性与实时性。
  • 对智能体工程而言,KV缓存迁移为具身智能系统提供了稳定的上下文延续能力,支持多轮、跨模型的任务编排;开发者无需重构对话状态管理逻辑,即可实现模型粒度的弹性调度,降低智能体工作流开发复杂度。
  • 对FDE落地而言,该方案直接缓解了企业级AI应用中因长上下文和多模型切换导致的推理成本陡增问题,使知识密集型RAG+Agent混合架构在生产环境中更具可行性,尤其利于需兼顾成本与精度的中大型组织规模化部署。

立即咨询 JOTO

JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询

想把这些做法用到你的业务里?

留下你的场景和痛点,我们帮你判断从哪一步开始。

联系我们
Contact Us

Start your enterprise AI rollout

Tell us your industry, team, and current pain points. We'll get back to you within one business day to help you decide what to tackle first, what data to prepare, and which platform fits.

WeChat
Scan to add us for a 1:1 chat
JOTO WeChat consultation QR code

Tell us what you need

Once we receive your details, we'll be in touch within one business day.