CacheBack:让多智能体只传递接收方真正需要的 KV Cache
多智能体系统要想协同完成复杂任务,关键问题并不只是“能不能通信”,还包括“应该传多少信息”。一名智能体可能处理了很长的上下文,但协作者通常只需要其中与当前子任务相关的一部分。若把完整上下文或完整 KV Cache 原样转交,通信就会迅速变成新的系统瓶颈。
从文本消息到潜在通信
传统做法是让发送方生成一段文本摘要,再交给接收方理解。这种方式便于检查和跨模型传输,但需要额外进行文本解码,而且摘要可能遗漏接收方完成任务所需的证据。近年来,一类潜在通信方法开始直接传递模型的 KV Cache,从而绕过部分文本生成过程,并有机会同时改善准确率和延迟。
问题在于,完整 KV Cache 的规模会随着单个智能体处理的上下文长度增加,也会随着参与协作的智能体数量增加。对于显存有限或上下文窗口较小的部署环境,直接累积这些缓存并不现实。
CacheBack 如何筛选信息
论文提出的核心观点是:通信内容应由接收方的局部任务决定。接收智能体先向发送智能体提供一份简短的信息需求描述,发送方再据此筛选自己的缓存。CacheBack 是这一思路的一个免训练实现,主要利用发送方的注意力权重判断哪些状态更可能与接收方相关,并压缩后再传递。
这种设计的价值在于,它没有要求重新训练一个专门的通信编码器,也没有把压缩完全交给人工摘要。通信过程仍然围绕模型内部状态展开,但筛选标准从“发送方处理过什么”转向“接收方需要什么”。
实验结果与意义
在 FanOutQA 上,使用 Qwen 3 的 CacheBack 去除了接收方原本会收到的 75% 状态,同时将准确率提高 14.7 个百分点;与文本通信相比,中位任务完成延迟降低 3.2 倍。论文还在稠密 Transformer、Mamba-注意力混合架构和滑动窗口注意力模型上报告了相近方向的改进,说明该方法并非只针对单一模型结构。
这项工作为多智能体推理提供了一个清晰的系统设计原则:通信不应默认追求完整,而应围绕接收方的任务进行裁剪。它可能降低多智能体部署中的显存、上下文和延迟压力,尤其适合需要频繁交换大规模中间状态的工作流。不过,摘要信息尚未说明不同任务、压缩比例和模型组合下的完整性能边界;实际应用仍需关注缓存兼容性、筛选误差以及工程集成成本。
评论
正在确认登录状态……
正在加载评论……