返回文章列表
记忆与上下文

RecGPT-V3:让推荐系统从“算历史”走向“有记忆的理解”

阅读约 3 分钟

导语

推荐系统正在从“根据历史点击预测下一次点击”,转向“理解用户为什么会做出选择”。RecGPT-V3 Technical Report 延续了 RecGPT-V1、V2 在淘宝推荐场景中的路线:把大语言模型引入推荐链路,让模型不仅识别行为共现关系,还能围绕用户意图进行推理。与前两代相比,V3 的重点不只是“更会理解”,而是把这种理解做成可持续、可落地、可控成本的工业系统。

核心要点

  • 从无状态请求到持续用户记忆:传统在线推荐请求往往需要反复处理用户完整行为历史,既消耗计算,也无法复用上一轮分析。RecGPT-V3 引入 Memory Hub,把长期行为压缩成结构化、可持续更新的用户记忆单元。论文称,这使用户建模计算量降低 55.8%。
  • 从自然语言标签到商品空间直连:只用自然语言标签表达用户意图,会在“理解用户”和“找到具体商品”之间形成信息瓶颈。V3 采用混合模态基础模型,同时处理文本标签和 Semantic IDs(SIDs)。前者适合表达开放、复杂的需求,后者用于将意图落到具体商品空间。
  • 从显式长推理到潜在意图推理:大模型如果在线输出冗长推理链,会带来延迟和成本压力。Latent Intent Reasoning 将大量显式推理 token 内化为更紧凑的可学习潜在 token,并且在需要时仍可解码为可读解释。报告称,这带来 3.46 倍端到端推理加速,并将输出 token 成本降低 200 倍。
  • 线上部署结果:RecGPT-V3 已部署在淘宝首页“猜你喜欢”信息流。大规模 A/B 测试显示,IPV 提升 1.28%,CTR 提升 1.00%,TC 提升 1.97%,GMV 提升 3.97%,同时端到端服务资源消耗下降 52.4%。

意义与影响

RecGPT-V3 的价值在于,它把 LLM 推荐从“能否推理”推进到“如何在工业规模下持续推理”。Memory Hub 对应的是用户长期上下文管理,SIDs 解决的是语言理解与商品召回/排序空间之间的落地问题,潜在推理则回应了在线服务最敏感的成本和时延。

这也反映出推荐系统的新趋势:大模型不会简单替代传统推荐架构,而是作为意图理解、记忆压缩和解释生成的上层智能模块,与商品 ID、行为序列和在线工程体系结合。对于电商、内容流和本地生活等场景,真正的挑战不只是模型能力,而是能否在高并发、低延迟、可解释和商业指标之间取得平衡。

需要注意的是,素材主要来自技术报告与项目介绍,公开信息集中在架构思路和线上指标,尚未展开更多外部复现实验细节。但从已披露结果看,RecGPT-V3 提供了一个重要样本:LLM 推荐系统要进入生产核心链路,记忆、grounding 与推理效率必须同时被解决。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
把验证知识“嫁接”进 KV Cache:小模型也能变成可复用知识飞轮?
记忆与上下文
cctest.ai
记忆与上下文

把验证知识“嫁接”进 KV Cache:小模型也能变成可复用知识飞轮?

一篇新论文提出用字节级精确的 KV Cache 嫁接,把已经验证过的知识保存为状态工件,并在后续推理中恢复到冻结小模型里。它的亮点是极低重复推理成本,但也面临可复现性与“能力提升”定义的争议。

阅读全文
CCTest · Blog
KV Cache 也会“偏心”:新论文揭示长上下文推理中的结构角色偏差
记忆与上下文
cctest.ai
记忆与上下文

KV Cache 也会“偏心”:新论文揭示长上下文推理中的结构角色偏差

一篇 arXiv 新论文指出,按注意力累计值淘汰 KV Cache 的方法,在嵌套 JSON 等结构密集文本上可能错误保留大量“结构噪声”。作者提出无需重训的角色条件分配策略,用较小额外开销缓解这一问题。

阅读全文