HeteroFold:让不同模型家族直接复用 KV Cache
在多智能体 LLM 系统中,不同模型往往承担不同角色:一个模型负责规划,另一个模型负责检索或执行,还有模型专门进行总结与验证。这样的异构组合可以利用各家模型的特长,但也带来一个容易被忽视的成本:当发送端已经处理过一段长上下文后,接收端如果通过文本接收这些内容,仍然需要再次执行 Prefill。
KV Cache 复用提供了减少重复计算的思路。模型在处理上下文时会生成 Key 和 Value,并将其缓存下来;后续生成阶段可以直接利用这些中间状态,而不必从头处理全部输入。不过,跨模型家族共享并不是简单地复制张量。不同模型可能使用不同的分词器、层数、注意力结构、KV 维度和表示空间,发送端的缓存并不能直接被接收端理解。
论文提出的 HeteroFold,正是针对这一跨家族兼容问题设计的预填充免除式传输方法。其核心包括三类对齐:首先处理不同分词器造成的 token 边界差异;其次对齐发送端与接收端的层结构;最后将发送端的 K/V 状态映射到接收模型可用的表示空间,并进行校准,使接收端的注意力模式和输出行为尽量保持稳定。方法的一个重要特点是发送模型和接收模型均保持冻结,训练的是连接两者的映射机制,而不是重新微调基础模型。
论文在 Llama、Qwen 和 Ministral 之间评估了六种传输方向,并覆盖长上下文、短上下文和多智能体场景。根据作者报告,HeteroFold 在四个长上下文基准上均取得最佳缓存传输表现,在多数短上下文设置中也优于对比方法。在 32K 上下文下,Llama 3.1 8B 向 Ministral 3 14B 的传输速度约为接收端原生 Prefill 的 10.7 倍,并较 Dense Latent、KV Ridge 等预填充免除式基线快约 1.18 至 1.47 倍。多智能体实验中,其效果与文本通信相当。
这项工作的价值不只是减少一次推理步骤,更在于把 KV Cache 从“单模型内部的临时状态”推进为异构模型之间可交换的计算资产。对于需要共享长文档、任务历史或环境状态的协作式 Agent,这可能降低延迟和重复算力消耗,也让模型家族的组合更加灵活。
当然,跨家族缓存转换仍依赖额外的映射与校准机制,实际部署还需要关注转换开销、缓存传输成本以及不同任务分布下的稳定性。现有材料主要呈现论文的基准结果,尚不足以说明所有模型规模和生产场景都能获得相同收益。更准确地说,HeteroFold 展示的是一条可行路径:让多智能体系统不必总是用文本重新表达已经计算过的上下文,而是尝试直接交换更接近模型内部计算结果的表示。
评论
正在确认登录状态……
正在加载评论……