SAS:让稀疏注意力直接为预测结果学习上下文排序
SAS 提出一种端到端训练的稀疏注意力方法,把选择器的连续分数注入注意力 Softmax,使语言建模损失能够直接优化上下文排序。在固定注意力预算较紧时,该方法有望更有效地保留真正影响预测的上下文。
阅读全文SAS 提出一种端到端训练的稀疏注意力方法,把选择器的连续分数注入注意力 Softmax,使语言建模损失能够直接优化上下文排序。在固定注意力预算较紧时,该方法有望更有效地保留真正影响预测的上下文。
阅读全文一篇最新 arXiv 论文提出,闭卷问答中的事实性幻觉并非只有“相关信息未被记住”这一种来源。即使模型见过事实,有限的内部存储也可能迫使它以有损方式保存,最终答错。
阅读全文长链式推理会让大模型的 KV 缓存随序列长度持续膨胀,成为推理部署中的主要内存瓶颈。BeaconKV 通过保存少量代表全局查询模式的“信标查询”,预测哪些历史上下文可能被再次访问,在压缩缓存的同时尽量维持推理效果。
阅读全文一项针对 Qwen3.5 和 Falcon-H1 的研究发现,混合语言模型中的 KV 缓存与固定大小递归状态承担着截然不同的任务。注意力更像事实查找表,而递归状态则决定模型接下来用什么语言、以何种 persona 作答。
阅读全文Random Attention 发现,在长链路推理中,KV 缓存未必需要复杂的逐 token 打分。只要保留提示词并在各注意力头内随机淘汰缓存,模型就能获得接近强选择器的效果,同时提升推理吞吐。
阅读全文LatentStream提出一种面向流式视频理解的潜在工作记忆框架,将历史视觉信息从外部记忆库逐步检索并内化为固定长度的潜在记忆。该方法试图在因果约束和有限内存下,让模型持续利用更早的视频上下文。
阅读全文LatentPress提出一种面向语言模型的上下文压缩方案:把对话历史和长文档编码为连续记忆Token,由冻结的解码器直接读取。实验显示,该方法在较高压缩率下仍能保持甚至超过原始上下文的部分任务表现,并显著降低读写成本。
阅读全文Anthropic正在合并Claude聊天与Cowork的记忆系统,让用户在讨论项目后,可以直接进入执行阶段。用户还能够查看、编辑或删除Claude保存的信息。
阅读全文大模型记住信息,并不意味着一定能更好地完成当前任务。MemTrapBench 揭示了两类由记忆诱发的认知陷阱,并提出 AdaptiveMem 作为推理阶段的缓解方案。
阅读全文一项覆盖多种记忆存储方式的统一评估显示,记忆系统的优劣取决于任务、上下文长度和运行成本。对长期运行的智能体而言,动态选择记忆基底可能比寻找单一最优方案更重要。
阅读全文OpenAI 正在 macOS 版 ChatGPT 桌面应用中引入 Computer History,让 ChatGPT 和 Codex 能参考用户近期的点击、输入和应用活动。它不像 Windows Recall 那样保存截图,但仍把个人电脑使用痕迹推向了更敏感的 AI 记忆场景。
阅读全文这篇工作把“记忆”当成小型工具型代理的补课机制:先从强教师的成功轨迹里提炼结构化经验,再按不同粒度注入给学生模型。核心不是再训练,而是用层级记忆提升小模型完成工具调用任务的成功率。
阅读全文一篇新论文指出,ALiBi 的线性位置偏置在浮点计算中可能发生下溢,使部分注意力权重被压成零,导致某些注意力头对远距离信息“失明”。研究显示,这一问题会明显影响 token 检索,但在常规解码器基准上未必显著暴露。
阅读全文一篇新论文将跨会话的个性化歧义适配定义为编程助手的新评测任务。其核心问题是:当用户再次用相似的模糊表达提需求时,模型能否借助过去已解决的会话少问问题、直接写出更符合意图的代码。
阅读全文这篇论文将 Memory Decoder 扩展到 6.9B 参数、300B token 预训练规模,试图证明“更大的记忆模块 + 较小的推理骨干”可能比单纯放大语言模型更高效。
阅读全文Metis 提出“记忆基础模型”概念,尝试将智能体记忆从外部检索与提示工程模块,推进为模型内部可持续演化的原生状态。其核心价值在于让历史信息以紧凑状态参与后续计算,而不是每次都重放上下文。
阅读全文CodeNib 试图解决编码智能体反复搜索同一代码库、上下文难以复用的问题。它为每个仓库提交构建词法、向量和结构化视图,并通过统一运行时向智能体提供检索、导航和受限上下文。
阅读全文这篇论文提出 Agentic Context Management(ACM),认为生产级智能体的记忆与成本瓶颈,本质上是上下文生命周期和架构问题,而不只是向量库检索问题。
阅读全文长上下文并不总是越多越好,尤其在编码代理处理工具输出时,冗余信息会迅速吞噬窗口。SWE-Pruner Pro 的思路是把“保留还是丢弃”直接交回给模型内部表示来判断。
阅读全文这项工作试图让 AI 不只是“看见”视频,而是把视频中的人、物、变化和事件真正记住。它的关键思路,是把记忆从按帧存储,转向围绕实体组织。
阅读全文