GLIE:用少量向量重建视觉文档检索表示
导语
视觉文档检索需要同时理解页面中的文字、布局和图像信息。晚交互模型通常为每个页面生成约一千个向量,并在查询时通过 MaxSim 逐项匹配查询向量与页面向量。这样的表示方式能够保留细粒度信息,却也让索引体积迅速膨胀,成为视觉文档搜索落地时的主要瓶颈之一。
论文提出的 Generative Late-Interaction Embeddings(GLIE),尝试在不重新训练文档编码器的前提下解决这一矛盾。它的核心思路不是简单删除向量,而是用少量向量保存页面表示的关键结构,并在需要时生成较完整的向量集合。
核心要点
- 先分析压缩为何失效。 研究者在三种编码器上观察到,页面向量都严格位于单位球面上,同时集中在内在维度约为五到六的低维流形附近。这说明约一千个向量包含大量冗余,但冗余并不等于可以随意取样。
- 修正聚类中心的位置。 标准 k-means 得到的中心通常落在球体内部,而原始向量位于球面上。直接使用这些中心会系统性低估 MaxSim 分数。将中心重新归一化到球面后,在报告的实验中,nDCG@5 相比未修正的中心最多提升 0.093。
- 让压缩表示兼具检索与生成作用。 GLIE 为每个页面学习远少于原始数量的 k 个向量。这些向量既用于建立轻量索引,也作为解码器恢复页面完整表示的基础;文档编码器保持冻结,只训练小型的细化模块和解码器。
- 把昂贵计算留给少数候选。 查询阶段先仅用 k 个向量检索,再对排名靠前的候选进行扩展。论文报告的设置只恢复前 20 个候选页面的向量,随后使用 MaxSim 进行精确重排。
实验与意义
在 ViDoRe v1 上,当每页只保存四个向量时,GLIE 保留了未压缩系统接近 80% 的 nDCG@5;作为对比,最佳的既有后处理压缩方法约为 70%。模型本身只有 415K 个参数,说明这套生成式压缩机制并不依赖一个庞大的附加网络。
这项工作的价值在于重新定义了多向量检索压缩的目标:压缩表示不必只是原始向量的子集或局部平均,也可以成为恢复原表示的“坐标”。不过,实验结果仍然是在特定视觉文档编码器、数据集和候选扩展策略下获得的。实际系统还需要权衡索引大小、解码开销、候选数量与召回率之间的关系。若这一思路能在更多文档类型和更大规模索引中保持稳定,视觉文档检索就有机会在较低存储预算下继续使用晚交互模型的细粒度能力。
评论
正在确认登录状态……
正在加载评论……