研究发现:LLM金融分析中用户角色提示导致的判断偏差主要来自解读而非证据检索

一项对12个LLM在3575份SEC文件上的测试显示,角色提示会改变模型对相同证据的解读,且两种缓解策略效果有限且因模型而异。

AI解读:这项研究揭示了一个实际风险:当你让AI扮演特定角色(比如“激进投资人”)去分析同一份财报时,即使它检索到的证据完全一样,给出的结论也可能因角色而不同——而且这种偏差主要出在“解读”环节,不是“选证据”环节。研究测试了12个大模型、3575份SEC文件,发现把投资人思维写成用户画像而非助手角色、把基于证据的输出和个性化输出分开,能减少偏差但无法消除,效果还因模型而异。对普通用户意味着:如果你用AI做投资分析,别把角色提示当成无关紧要的“加戏”,它可能悄悄改变结论;最好同时用无角色提示跑一遍对比,再把模型输出的判断交给自己复核,而不是直接采信。研究尚未经同行评审,且主要覆盖SEC文件场景,其他领域偏差程度未知。

一项针对12个大型语言模型(LLM)的新研究发现,用户提供角色提示、记忆或个人画像等上下文信息,会显著改变模型对相同财务证据的解读,从而导致不同结论,且这种偏差主要来自模型对证据的“解读”差异,而非检索到的证据内容差异。该研究基于3575份美国证券交易委员会(SEC)文件,由Ahmed Asaad、Amr Mohamed、Yang Zhang和Omneya Abdelsalam完成,预印本发布于arXiv(编号2609.03218),尚未经同行评审。

研究团队通过对比“人设条件检索”(persona-conditioned retrieval)、“中性检索”(neutral retrieval)和“记忆框架上下文”(memory-framed context)三种条件,来区分证据选择与证据解读各自的影响。结果发现,多数“用户上下文溢出效应”(即个人化上下文对判断的干扰)源于模型在不同角色下对同一证据的解读方式不同,而非模型检索到不同证据。

测试设计与核心发现

该研究使用3575份SEC文件,覆盖12种不同LLM。研究人员设计了三种条件:人设条件检索要求模型以特定投资人角色分析文件;中性检索不提供任何角色;记忆框架上下文则在提示中模拟模型“记忆”了用户过去的投资偏好。通过对比这些条件,团队试图将个人化上下文的影响拆解为“证据选择”(模型选读了哪些文本)和“解读”(对同一证据的不同理解)两部分。

结果显示,用户上下文对判断的溢出效应主要发生在解读环节:即便不同条件下模型读取的证据高度重叠,其给出的财务判断(如风险评估或投资建议)仍会因角色设定而明显分化。研究还测试了两类简单缓解策略:一是将同样的投资人思维表述为“用户画像”(user profile)而非“助手角色”(assistant role);二是将基于证据的分析与个性化建议分开输出。

研究发现,这两种策略都能降低溢出效应,但均不能完全消除偏差,且效果在不同模型间差异显著——某些模型在一种策略下改善明显,换一种策略则收效甚微。

  • 研究对象:3575份SEC文件,12种LLM。
  • 主要发现:用户上下文导致的判断差异主要来自解释阶段,而非证据检索阶段。
  • 缓解策略测试:将投资人思维作为用户画像而非助手角色;将基于证据和个性化的输出分开。
  • 结果:两种策略均减少偏差但未完全消除,且效果因模型而异。

信息来源