返回文章列表
推理与部署

让语言模型自己决定看哪里:Declarative Attention如何减少长上下文开销

阅读约 3 分钟

导语

长上下文模型的瓶颈,不只是“能不能装下更多Token”,还在于生成每个新Token时,是否必须反复读取整个上下文。即使模型最终只需要其中一小部分信息,标准全局注意力仍可能扫描完整KV缓存。在百万Token级对话中,这种读取成本会随着输出长度持续累积。

KAIST AI团队提出的Declarative Attention(DA),尝试让模型自己说明“接下来需要看哪里”。这不是另建一个外部检索器,而是一套供模型和推理引擎协作的注意力协议。

核心机制

DA把生成过程划分为三种模式:

  • global:访问完整上下文,适合需要全局信息或重新定位线索的步骤;
  • focus:访问指定区域,模型可以将注意力集中到某个上下文片段;
  • local:只读取近期生成内容,用于不需要回看长上下文的连续推理。

模型在链式推理过程中输出相应声明,推理引擎像解析工具调用一样识别这些标记,并据此决定读取哪些KV缓存。若模型判断当前步骤只需要局部信息,引擎便无需每次都扫描全部缓存。

这一思路区别于先由外部模块为所有候选Token打分、再筛选相关内容的方法。后者虽然可以减少实际读取量,但打分过程本身仍可能需要对长度为N的上下文进行逐步处理。DA则利用模型已经形成的相关性判断,试图把“选择注意力范围”直接纳入生成流程。

评测结果与限制

素材显示,研究者在15项长上下文任务上进行了零样本评测,使用了Gemma-4-31B和Qwen-3.6-27B等现成模型。两者的总关注Token分别减少52.0%和31.1%,同时准确率出现小幅下降,摘要给出的数值分别为1.27个百分点和2.75个百分点;页面截取内容对Gemma的下降幅度则写为1.52个百分点,具体数字仍应以论文正式版本为准。

这说明DA并非免费加速:模型一旦错误地声明了关注范围,就可能遗漏回答所需的信息。不过,素材指出,随着模型规模增大,准确率损失有缩小趋势。与此同时,实验属于零样本设置,尚不能直接说明经过专门训练后,模型能否更稳定地发出准确声明。

意义与影响

DA提供了一个不同于传统压缩、外部检索和代理打分的稀疏注意力方向:让模型参与决定自己的上下文访问策略。它可能为百万Token对话、长文档分析和高输出长度任务降低推理带宽与缓存读取压力。

但实际部署仍需关注声明格式的鲁棒性、错误聚焦后的恢复机制,以及节省的读取量能否转化为端到端延迟和成本下降。后续若结合训练方法,模型或许能学会在速度与信息完整性之间做出更可靠的取舍。就现阶段而言,DA更像是一项展示“模型可以控制自身注意力”的研究原型,而不是已经解决长上下文推理成本的通用方案。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章