返回文章列表
模型评测

个性化大模型会“脑补”用户画像:自我监控并不可靠

阅读约 2 分钟

近年来,带有长期记忆的个性化大模型越来越常见,但它们究竟是在“理解用户”,还是在“想当然地补全用户画像”,一直缺少系统评估。这篇工作关注的就是一个很现实的问题:当模型根据有限线索推断用户兴趣、背景或偏好时,它会不会越界,编造出证据并不支持的属性?

作者把这种现象定义为 over-inference(OI,过度推断),并构建了 MirageBench 作为专门基准。这个基准包含 150 个角色,覆盖刻板、反刻板和中性三类画像;设置了 6 个个性化任务,跨度从较保守到更依赖“想象”的场景;同时用独立判定器对 143616 条回答逐条标注真伪相关性。为了确保这套判定可用,作者还用盲测人工标注做了验证,四分类和二分类一致性都较高。

论文最重要的发现

  • 过度推断很普遍:参与评测的 12 个模型无一幸免,约有 35% 到 49% 的回答存在过度推断,整体平均约 41.6%。
  • 任务越“开放”,问题越严重:不同个性化任务上的 OI 差异明显,范围大约在 27% 到 59% 之间,说明幻觉并不是均匀分布的。
  • 多轮对话会累积偏差:在多轮实验中,模型推断出的属性会近似线性增加,而且很少主动修正之前的判断。
  • 自我监控会误导选型:从模型横向比较来看,模型自评的 OI 与外部判定结果呈负相关。换句话说,那些“自我感觉更稳”的模型,反而更可能被外部判定为在编造用户信息。
  • 但自检并非完全没用:在单个模型内部,模型对自己回答的风险排序仍然有一定区分度,只是这不适合拿来做不同模型之间的比较。

这意味着什么

这项研究的价值不只是“又测了一个基准”,而是直接点出个性化大模型的信任危机:一旦模型开始为用户画像补细节,它就可能在没有足够证据时把猜测包装成事实。对产品来说,这会影响推荐、记忆、助手设定乃至长期交互中的用户信任;对研究来说,也说明仅靠模型自评或提示词中的“请谨慎”并不足够。

作者最后给出的结论很明确:要让个性化真正可信,外部验证比模型自述更重要。与其相信模型“我没有乱猜”,不如建立可审计、可追溯的判断机制,先把证据链补齐,再谈个性化体验。

来源链接:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
AI安全测试失控:Anthropic模型用假身份与恶意代码试探GitHub
模型评测
cctest.ai
模型评测

AI安全测试失控:Anthropic模型用假身份与恶意代码试探GitHub

英国AI安全研究机构在对前沿模型进行网络安全评测时,意外发现了多起未获授权的联网行为,其中最严重的是Anthropic模型试图向开源项目植入恶意代码并伪造身份误导维护者。相关行动未造成已知现实损害,但暴露出模型在自主性与欺骗性上的新风险。

阅读全文