UEmbed:把稀疏检索与稠密多模态向量放进同一个解码器
导语
检索系统长期存在一条清晰分工:稀疏检索擅长利用词项匹配与倒排索引,稠密检索擅长捕捉语义相似性。到了 RAG 和多模态应用阶段,这种分工也带来了新的复杂度——系统往往要同时维护 BM25/学习型稀疏检索、向量数据库、多模态对齐模块等多套组件。UEmbed 的目标正是把这两类表示合并到一个模型框架里。
这篇来自 Alibaba-NLP 的论文提出 UEmbed(Unified Embedding),一个 decoder-only 多模态嵌入模型。它能够在一次因果前向计算中,同时输出稀疏词法向量和稠密表示,从而把传统上分离的检索路径统一起来。
核心要点
- 统一稀疏与稠密表示:UEmbed 不再把稀疏检索和稠密检索视为两套独立模型,而是在同一个多模态解码器中生成两种 embedding,便于下游系统按任务需求组合使用。
- 摆脱编码器式 LSR 的惯性:学习型稀疏检索(LSR)过去多依赖双向 encoder 架构。UEmbed 将这一能力迁移到 decoder-only 模型中,更贴近当前大模型与多模态模型的主流技术栈。
- 特殊 token 分区预测稀疏向量:模型会在输入后追加 N 个可学习特殊 token,并把词表划分为 N 个互不重叠的子集。每个特殊 token 的因果隐藏状态只负责预测对应子集的稀疏权重,最后拼接成完整稀疏向量。
- 覆盖文本与多模态输入:论文强调,UEmbed 不仅统一了稀疏和稠密表示,也把稀疏检索能力扩展到文本与多模态输入的统一场景中,减少对额外跨模态模块的依赖。
- 公开数据训练与多规模发布:研究团队发布了 2B、4B、9B 三个规模版本。摘要显示,UEmbed-9B 在 MMEB-v2 上取得 dense 71.8、sparse 71.0 的成绩,并在 BEIR 上与强稠密、稀疏基线保持竞争力。
意义与影响
UEmbed 的看点不只在分数,而在系统设计思路。现实中的搜索和 RAG 往往需要稀疏检索的可解释性、词项召回能力,也需要稠密向量的语义泛化能力。过去工程上常用混合检索来折中,但代价是模型、索引和部署链路更复杂。若一个模型能稳定地产出两类表示,就可能简化训练、推理与召回编排。
对多模态 RAG 而言,这一点尤其重要。图文检索、文档问答、智能体调用外部知识库等任务,都要求模型在不同输入类型之间建立可检索的共享空间。UEmbed 选择在 decoder-only 架构上完成统一,意味着它可能更容易与现有大模型工作流衔接,例如作为智能体的记忆检索器、工具检索器或多模态知识入口。
当然,摘要层面仍无法回答全部工程问题,例如不同规模下的延迟、索引成本、稀疏向量维度带来的存储压力,以及在私有领域数据上的迁移表现。但从研究方向看,UEmbed 提供了一个值得关注的范式:不是在稀疏与稠密之间二选一,而是让同一个多模态模型同时服务两类检索信号。
评论
正在确认登录状态……
正在加载评论……