个性化大模型会“脑补”用户画像:自我监控并不可靠
近年来,带有长期记忆的个性化大模型越来越常见,但它们究竟是在“理解用户”,还是在“想当然地补全用户画像”,一直缺少系统评估。这篇工作关注的就是一个很现实的问题:当模型根据有限线索推断用户兴趣、背景或偏好时,它会不会越界,编造出证据并不支持的属性?
作者把这种现象定义为 over-inference(OI,过度推断),并构建了 MirageBench 作为专门基准。这个基准包含 150 个角色,覆盖刻板、反刻板和中性三类画像;设置了 6 个个性化任务,跨度从较保守到更依赖“想象”的场景;同时用独立判定器对 143616 条回答逐条标注真伪相关性。为了确保这套判定可用,作者还用盲测人工标注做了验证,四分类和二分类一致性都较高。
论文最重要的发现
- 过度推断很普遍:参与评测的 12 个模型无一幸免,约有 35% 到 49% 的回答存在过度推断,整体平均约 41.6%。
- 任务越“开放”,问题越严重:不同个性化任务上的 OI 差异明显,范围大约在 27% 到 59% 之间,说明幻觉并不是均匀分布的。
- 多轮对话会累积偏差:在多轮实验中,模型推断出的属性会近似线性增加,而且很少主动修正之前的判断。
- 自我监控会误导选型:从模型横向比较来看,模型自评的 OI 与外部判定结果呈负相关。换句话说,那些“自我感觉更稳”的模型,反而更可能被外部判定为在编造用户信息。
- 但自检并非完全没用:在单个模型内部,模型对自己回答的风险排序仍然有一定区分度,只是这不适合拿来做不同模型之间的比较。
这意味着什么
这项研究的价值不只是“又测了一个基准”,而是直接点出个性化大模型的信任危机:一旦模型开始为用户画像补细节,它就可能在没有足够证据时把猜测包装成事实。对产品来说,这会影响推荐、记忆、助手设定乃至长期交互中的用户信任;对研究来说,也说明仅靠模型自评或提示词中的“请谨慎”并不足够。
作者最后给出的结论很明确:要让个性化真正可信,外部验证比模型自述更重要。与其相信模型“我没有乱猜”,不如建立可审计、可追溯的判断机制,先把证据链补齐,再谈个性化体验。
评论
正在确认登录状态……
正在加载评论……