返回文章列表
记忆与上下文

LatentPort:让不同规模模型直接交接“记忆”,不再重放上下文

阅读约 2 分钟

导语

大模型切换时,最常见的做法是让新模型重新读取完整上下文,或者只搬运注意力层产生的 KV Cache。前者成本高,后者又可能丢失混合架构中由循环模块积累的长期信息。论文 LatentPort 提出了另一种思路:把模型处理文本后留下的多类内部状态一起交给另一个模型,让接收方从“半程”继续推理,而不是重放历史前缀。

实验做了什么

研究者选择了架构匹配的 Qwen3.5 4B 与 9B Base 模型。4B 先处理 4096 个上下文 token,随后向 9B 传递翻译后的注意力 KV,以及混合模型中的 Gated DeltaNet(GDN)循环状态和卷积状态。9B 不读取任何历史前缀,只对后续内容进行推理和评估。

核心结果包括:

  • 只迁移 KV Cache 时,目标模型与原生 9B 之间仍存在明显差距。
  • 加入 GDN 持久状态后,教师强制负对数似然平均降低 0.747 nats/token,95% 配对文档 bootstrap 置信区间为 0.6921–0.8047;PG19 的 64 篇文档全部改善。
  • 直接复用循环状态和卷积状态,效果优于本次测试的学习式 GDN 映射,说明两个尺寸模型之间的部分状态坐标可能具有功能兼容性。
  • 在新加入的 434176 参数校正模块后,64 篇网页文档上的续写损失仅比原生 9B 高 0.076 nats/token,JS 散度为 0.022,原生上下文恢复指标为 0.918。

校正后的 9B 还显著优于继续运行 4B 的方案,同时没有处理任何历史前缀 token。换言之,模型升级不必总是以“重新读一遍上下文”为代价。

意义与边界

LatentPort 的价值在于把模型状态交接从 KV Cache 扩展到更完整的混合状态。对于长上下文服务、模型级联、动态升级或多模型协作,这可能减少前缀重算,并为未来的“状态接口”提供实验依据:模型之间传递的或许不只是 token 和概率分布,也可以是可解释程度更低、但更接近运行时记忆的内部表示。

不过,这项结果还不能等同于通用的跨模型记忆协议。实验只覆盖一个方向、一个架构匹配的 4B→9B 模型对和 4K 教师强制续写;近原生的门控分支失败,16K 分支未运行,公开材料也没有证明自由生成能够达到等价效果。因此,状态坐标能否跨架构、跨训练版本稳定迁移,以及迁移是否会带来安全隔离和隐私问题,都仍需进一步验证。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章