研究:人类心理问卷无法可靠衡量LLM在日常交互中的行为

arXiv预印本论文发现,基于Likert量表的问卷得分与模型对日常用户查询的生成概率分布显著偏离,问卷结果不宜作为LLM真实响应倾向的证据。

AI解读:这篇论文的核心发现是:当用人类心理问卷(如PVQ和BFI)给大语言模型打分时,得到的性格和价值倾向并不能代表它们在真实用户对话中的行为。原因是问卷题面本身就带着明显的词汇线索,模型能识别出题目在测什么,然后给出符合社会期待或对齐要求的"标准答案"——比如被问到助人题就偏向利他,被问到外向题就装外向。但普通用户不会用这种直白的方式提问,所以模型在日常交互中的实际表现和问卷得分对不上。这项研究提醒开发者和研究者,评估LLM的性格或价值观不能只看问卷分数,否则会高估模型在角色扮演(如模拟特定人口群体)时的可信度。对普通用户来说,这篇文章的意义在于不必太在意某些评测或排行中声称的LLM"性格",那很可能只是模型在配合测试。

一项发表在arXiv上的预印本研究(编号2509.10078,已被EMNLP 2026主会接收)指出,用人类心理测量问卷来衡量大语言模型(LLM)的价值和人格特质并不可靠。研究者对比了八款开源LLM在两种方法下的表现:一是让模型在Likert量表上自我报告(使用PVQ-40/21和BFI-44/10问卷),二是计算模型对日常用户查询中价值相关回答的生成概率。结果显示,两种方法得出的画像显著不一致。

问卷包含显性线索,模型会刻意迎合

研究者发现,既定问卷题目中含有明确的词汇线索,模型能据此识别出目标构念,从而给出与对齐要求和社交期望一致的回答;而真实用户查询中这种线索要少得多。这一发现解释了为何问卷常显示模型具有稳定的"内在倾向"——这种稳定在生成概率中并不存在。

论文还测试了人口统计人格提示的影响:当给模型加载特定人口群体的人设(如年龄、性别、职业)后,问卷回答确实像真人那样发生偏移,但生成设置中并未出现类似偏移。这说明人类问卷高估了LLM在扮演人口统计人格时忠实复现预期心理特质的能力。

建议改用生态效度更高的生成概率分析

研究结论是:问卷分数本身不应被当作LLM在真实用户交互中响应倾向的证据。作者建议采用基于生态效度项目的生成概率画像作为补充性行为测量方法。该研究涉及的两个问卷体系分别为施瓦茨价值观问卷(PVQ-40/21)和大五人格量表(BFI-44/10),均属心理学领域常用工具。

信息来源