arXiv新研究:医疗聊天机器人幻觉检测中,单轮标注基准易漏计事实错误

多视角裁决研究显示,医疗聊天机器人事实错误检测中,单轮标注常漏检,LLM-as-a-Judge虽提升候选发现但自身不足。

一项针对医疗相关聊天机器人回答的多视角标注研究发现,一次性人工标注常漏过事实错误;采用LLM-as-a-Judge(LaJ)辅助发现候选错误后,仍需医疗专家和基于证据的事实核查进行裁决。研究称,单轮幻觉基准可能以低估错误数量为代价实现规模化。该论文由Joe Cecil和Marjorie Freedman撰写,共34页,含6幅图,将发表于Findings of the ACL: EMNLP 2026,预印本arXiv:2609.03953于2026年9月3日提交。

研究方法与主要发现

研究开发了多视角标注流程,用于处理医疗相关聊天机器人回答,流程包括:第一轮标注、LaJ候选发现,以及两种形式的裁决——医疗专家评审和基于证据的事实核查。研究者指出,在长文本聊天机器人回答中,事实错误通常很细微,且嵌入在大部分正确的文本中。

结果表明,第一轮标注者经常漏掉后来被裁决者确认为事实错误的条目。LaJ虽能提升候选错误发现率,但本身不够充分——它会漏掉标注者能发现的事实错误。此外,不同裁决者之间也出现意见分歧,提示对多个候选来源进行裁决可提高基准覆盖面,但不能消除对判断和专业知识的依赖。

  • 该技术应用于现有基准时,同样暴露出类似模式的缺失标注。
  • 作者总结,在所考察的情境下,单轮幻觉基准可能以漏计事实错误为代价换取规模;多轮裁决可提升覆盖率,但基准推断仍对用于判断错误的专家意见、专业能力和证据敏感。

信息来源