Embedding 该不该换成 LLM?性能接近,成本却相差 1431 倍
导语
当大语言模型开始被用于生成向量,传统的文本 Embedding 管线似乎迎来了替代者。LLM 能理解更复杂的语义和任务意图,是否意味着企业应该把向量模型全部换掉?《The Embedder's Dilemma》没有停留在模型能力的宣传上,而是进行了一次同时考察效果、成本与速度的对照评测。
一场覆盖多类任务的比较
研究团队测试了 10 个来自 6 个家族的 LLM,以及 26 个参数量从 1.18 亿到 140 亿的 Embedding 模型。评测覆盖 37 项任务,包括分类、语义文本相似度(STS)、聚类、成对分类和检索,并将模型质量与推理开销放在同一框架中比较。
核心结果并不是“LLM 全面胜出”。总体来看,两类模型几乎打成平手:表现最佳的 LLM Gemini 3.1 Pro 得分为 77.6,最佳 Embedding 模型为 77.2,仅相差 0.4 分。这说明在大量标准语义任务中,更大的生成式模型并不会自动带来显著优势。
但按任务拆分后,差异很明显:
- 推理密集型检索:LLM 更有优势,尤其适合需要结合查询意图、上下文和多步判断的场景。
- 分类:专用 Embedding 模型表现更好,适合高吞吐、边界相对稳定的标签判断。
- 聚类、STS 与成对分类:两类模型的表现大致相当。
- 成本与速度:一次基准测试中,LLM 成本最高可达 154 美元,而可比 Embedding 模型约为 0.11 美元,差距最高达到 1431 倍。测试中的开放 LLM 在同一 GPU 上处理 token 的速度也慢约 2.5 到 736 倍。
“会推理”并不等于值得部署
成本差距的一个重要来源是推理 token。研究发现,推理 token 占 LLM 推理成本的 28% 至 81%。更值得注意的是,在消融实验中,降低推理预算对多数模型的检索质量并没有造成明显损害,部分情况下还会改善结果。这提示开发者不能只看模型的峰值能力,还应测量实际任务所需的推理深度。
从效果—成本的 Pareto 前沿来看,领先的 Embedding 模型仍占据重要位置,LLM 中只有 Gemini 3.1 Pro 进入前沿。换句话说,LLM 的价值主要集中在少数复杂任务,而不是所有向量化需求。
对 RAG 管线的启示
这项研究支持一种“分工式”架构:用 Embedding 模型承担相似度计算、分类和聚类,把 LLM 留给需要语义推理的检索环节。实际系统还应结合数据类型、延迟目标、调用费用和吞吐量进行端到端测试,而不能仅凭排行榜决定迁移。
因此,Embedding 模型并没有因为 LLM 能够生成向量就失去意义。更合理的问题是:哪一环真正需要推理,哪一环只需要稳定、便宜且快速的语义表示?
评论
正在确认登录状态……
正在加载评论……