返回文章列表
模型评测

LLM生成的问卷回答看似真实,却未必符合心理测量学

阅读约 3 分钟

导语

让大语言模型扮演问卷受访者,已经成为市场研究、社会科学和产品调研中的常见设想。过去的评估往往只问一个问题:模型给出的回答像不像一个真实的人?这项题为《Plausible but Not Valid: A Psychometric Audit of LLMs as Synthetic Survey Respondents》的研究提出,真正需要检验的并不是“像不像”,而是这些回答是否具备心理测量学意义上的有效性。

研究如何审计模型

研究者使用一组立陶宛组织心理学数据,样本包括263名员工,问卷共68个题项、12个分量表,覆盖对组织变化的态度、工作投入以及工作绩效等主题。研究随后测试了37个模型,范围涵盖OpenAI、Anthropic、Google等商业模型,以及12个开放权重模型家族。

实验没有只给模型一种提示,而是设置了五级人物信息披露梯度,并比较了题目呈现方式和推理投入等条件。研究还进行了人口统计反事实替换,例如交换性别、职位和教育背景,加入跨语言检查,并设置逐字记忆召回测试,以判断结果是否可能受训练数据记忆影响。

为避免把“回答流畅”误当成“数据有效”,论文构建了Psychometric Similarity Score(PSS),考察联合分布、潜在结构、信度、中介路径及人口统计效应等维度。这个指标还与五种非LLM统计基线和保留的人类—人类相似性上限进行对照,并使用受访者自助法置信区间及题项置换检验增强比较的稳健性。

核心发现

  • LLM能够复现人类心理测量关系的总体方向,但这并不代表其保留了真实数据的完整结构。
  • 高斯Copula统计基线在由样本驱动的PSS组件上超过了所有被测LLM,说明简单的分布建模方法可能比直接让模型“扮演人类”更接近目标数据。
  • LLM之间的平均相互PSS为0.73,模型群体彼此的相似度高于它们与人类数据的相似度。换言之,多个模型给出相近答案,不一定意味着答案更接近真实人群。
  • 反事实替换显示,教育背景带来了较明显的模型响应变化,平均绝对效应量为0.56。这提示模型可能会系统性地放大某些人口统计线索,但不能据此断言其重现了真实社会机制。
  • 逐字召回与PSS排名的相关系数为0.00,研究结果没有显示记忆召回是排行榜差异的主要来源。

意义与影响

这项工作把合成受访者的评价重点,从单个回答的“合理感”推进到群体数据的结构有效性。对市场调查和社会科学研究而言,平均值接近、文字自然或个体画像逼真,都不足以证明模型可以替代真实样本。若研究目标涉及相关关系、量表信度、潜变量或群体差异,就必须进行更严格的联合分布和心理测量验证。

研究也没有简单得出“LLM完全不能用于问卷”的结论。它更明确地指出:合成数据应与统计基线、人类数据上限和反事实测试共同评估;模型间的一致性也不应被直接当作真实性信号。未来,合成受访者系统若要用于决策,至少需要在不同语言、文化和样本规模上重复验证,并清楚区分“生成了像人的回答”和“生成了有效的群体测量数据”。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章