LLM智能体会偏爱某些来源:搜索结果中的“来源偏见”如何形成
当AI智能体替用户挑选商品、预订酒店,甚至决定引用哪篇论文时,它看似是在比较价格、功能、位置或相关性,实际上还可能在意一个容易被忽视的变量:选项来自哪里。
来源标签会改变选择
首尔国立大学研究团队在购物、酒店和学术搜索三个领域,对12个智能体模型开展了端到端搜索实验。研究者将来自不同来源的候选项放在相同位置,并尽量让它们满足相同的用户要求,以观察模型是否仍会偏向某些网站、服务或内容提供方。
结果显示,几乎每个模型在各个领域都表现出来源偏好:它们会反复选择某些来源,同时回避另一些来源,而且不同模型对哪些来源更受欢迎、哪些来源更容易被忽略,整体上存在较强一致性。这并不只是“更好的选项自然胜出”。在一组对比中,当来自偏好来源的选项少满足一项要求、而来自不偏好来源的选项表现更好时,模型仍会在大约三分之二的情况下选择前者;如果来源偏好与选项质量方向相反,选择优质选项的情况则几乎不存在。
研究还发现,来源信息本身就能影响决策。隐藏来源标签后,原有偏好会减弱;只改变选项的来源标识、把它标成模型偏好的来源,选择率就可能上升。这意味着模型并非总是在读取并综合所有产品或内容属性,来源名称也可能成为独立的决策信号。
偏好可能从哪里来
研究提出了两条解释路径。第一,在训练过程中,如果某个来源经常与更好的结果同时出现,模型可能学会把来源当作判断质量的快捷线索。这样的捷径在信息充足时或许有效,但也会让模型在面对新的候选项时过度依赖来源。
第二,当候选项缺少价格、功能、限制条件或其他关键细节时,模型可能用对来源的既有印象填补空白。来源于是从一个描述性信息,变成了对未知属性的推断依据。
如何降低影响
实验表明,减少来源偏好并不一定要重新训练模型。向智能体提供缺失的关键信息,可以压缩其依赖预设的空间;在提示中明确要求它不要根据来源推断未提供的属性,也能降低这种偏好。更稳妥的工作流还应要求智能体先列出用户需求,再逐项核验候选项,最后说明选择依据,而不是直接按来源或品牌给出结论。
这项研究对搜索、推荐和代理式购物都有直接启示:当智能体替用户分配注意力和消费时,来源偏好可能把流量集中到少数平台,也可能让用户错过更符合自身需求的选项。未来评估智能体时,除了准确率和任务完成率,还应检查它是否能在来源标签变化后保持一致、可解释且基于属性的判断。
评论
正在确认登录状态……
正在加载评论……