新基准揭示医学多模态模型答题依赖捷径:去除文本线索后准确率大幅下滑

一项预印本研究提出“推理膨胀”概念,指出医学多模态选择题的分数可能来自非视觉线索,并发布1,000题的捷径缓解子集MedQA-MM。

AI解读:医学多模态模型的基准分数可能虚高:研究者发现,模型答对医学影像选择题,有时靠的是选项措辞、非影像临床文字或图像上本就存在的文字等捷径线索,而不是真的看懂图像。他们在六个数据集上测试了13种开源模型,完整输入的平均准确率为62.63%,但只看文字不看图也能达到53.96%,只看选项就有29.71%。为此,他们制作了MedQA-MM子集,专门去除这类线索,结果文字和选项的背景准确率分别掉到5.21%和12.33%。这意味着,医疗AI厂商如果用现有基准宣传“影像推理能力”,用户应当要求看分路测试的证据,而不是只看总分。对医生和医院来说,现阶段不必因这个研究改变临床使用,但采购评估时应要求供应商提供去除捷径后的分路准确率,并警惕仅凭高分就宣称读懂影像的产品。

一项发表在arXiv的预印本研究警告,医学多模态选择题的高分可能并不代表模型真正具备医学影像推理能力。作者将这种现象称为“推理膨胀”:模型正确作答的路径,可能是题目中保留的线索——选项措辞、非视觉临床文本、图像可见文字、人工标注或设备/上下文伪影——而非预期的影像发现。

实验设置与主要数字

研究覆盖六个医学多模态选择题数据集,作者通过提示与图像侧审计、模态消融以及保留医学目标和答案键的匹配修复,将候选线索与行为证据分开。

在13种配置的开源模型面板上,完整输入的平均准确率为62.63%,仅文本设置达到53.96%,仅选项设置达到29.71%。去除长度差、绝对/显著性和空间/介词线索后,准确率分别下降6.58、3.50和4.77个百分点。

  • 完整输入准确率:62.63%(13模型平均)
  • 仅文本准确率:53.96%
  • 仅选项准确率:29.71%
  • 去除长度差线索:-6.58个百分点
  • 去除绝对/显著性线索:-3.50个百分点
  • 去除空间/介词线索:-4.77个百分点

MedQA-MM子集与结论

作者构建了MedQA-MM,一个包含1,000道题的捷径缓解子集。在该子集上,仅文本和仅选项的准确率分别降至5.21%和12.33%。

作者强调,这不意味着模型从不使用图像,而是表明医学图像推理的主张需要路由级证据。论文指出,基准分数只记最终答案,不记答题路径;路由是可观察的输入路径,不涉及模型内部认知的推断。

信息来源