Context Language Models:让语言模型自己管理上下文
导语
长上下文并不等于有效记忆。对于需要持续浏览、编程或协作的智能体而言,真正困难的往往不是把更多文本塞进窗口,而是在任务推进过程中判断哪些信息必须保留、哪些内容可以压缩或删除。现有系统通常由外部 harness、摘要器或检索模块执行这些操作。Meta 团队提出的 Context Language Models(CLMs)则尝试把这项工作交还给语言模型本身。
核心思路:把上下文当作文件
CLM 的关键抽象很直接:将上下文表示为一个文件,并允许模型对文件进行不受限的更新。模型不只是读取历史记录,也可以主动重写、整理和维护其中的内容。这样一来,上下文管理不再是固定的截断、摘要或检索规则,而成为模型行为的一部分。
这一设计也适用于多智能体系统。不同智能体可以拥有各自的上下文文件,彼此独立维护任务状态;系统因此能够更自然地表达协作过程中的角色分工和信息边界。更重要的是,管理上下文的策略可以通过模型自身的上下文学习或参数学习获得,而不必完全依赖外部控制器。
实验结果与训练方式
论文摘要报告,使用现有模型以零样本方式构建 CLM 后,在多个任务上超过了现有上下文管理策略:
- 在 BrowseComp-Plus 上,准确率提高 11.4%,同时 FLOPs 减少 21.5%;
- 在 12 小时 EdgeBench 上,得分提高 5%,计算量减少 59%;
- 在 24 小时多仓库 agent-swarm 任务中,以相同计算量获得 65% 更大的改进。
研究还展示了几种进一步优化路径。通过标准的技能优化循环,模型可以接受自然语言形式的上下文管理指令,在一个上下文管理任务的留出数据上最多提升 35.9 个百分点,并减少计算开销。在线强化学习则让 Qwen3.5-9B 在 BrowseComp-Plus 上提升 47.6%,同时使用少 12% 的 FLOPs。
在部署层面,论文同步提出与 CLM 配套的 Suffix Cache Reuse。在性能相当的情况下,该方法相较标准 SGLang 进一步降低 35% 的服务器端计算量,说明上下文自主更新并不必然意味着推理成本失控。
意义与待观察问题
CLM 的价值在于重新划分了上下文管理的职责:外部系统不再需要预先规定所有记忆策略,模型可以根据任务动态决定信息组织方式。这可能为长程智能体、代码代理和多智能体协作提供更统一的基础架构。
不过,摘要并未披露各项基准的完整配置、上下文文件更新细节及不同任务上的误差分布。因此,现阶段更适合将 CLM 视为一种具有潜力的系统设计范式,而不是已经解决长期记忆、可靠性和可控性问题的最终方案。模型如何避免误删关键信息、如何审计上下文变化,以及这种自由更新机制在更复杂环境中的稳定性,仍值得继续验证。
评论
正在确认登录状态……
正在加载评论……