新基准FPCO-Dialog测试多模态模型多轮对话中纠正错误前提的能力

该基准包含1080张图片和10800个问题回合,评估20个商用及开源视觉语言模型在重复错误前提下的纠正与合作行为。

AI解读:视觉语言模型(VLM)在实际对话中常会遇到用户基于错误假设描述图像的情况,而现有评测很少关注多轮对话中同一错误前提反复出现时模型的反应。FPCO-Dialog基准正是为此设计:它包含1080张图片和10800个问题回合,用10轮对话协议先给出正确前缀,再反复使用带错误前提的指代表达,测试模型能否持续纠正用户。研究者用两个独立检测器评分,定义了CorrTP@K这一衡量错误前提回合纠正率的指标,并评估了20个商用和开源VLM。结果显示,模型之间的纠正倾向差异显著且持久,不同错误前提类型下表现也有系统性变化。对开发者而言,这意味着在选择或优化VLM用于多轮交互场景时,不能只看单轮问答能力,需要关注模型在重复错误前提下的坚持纠正能力;普通用户则无需立即行动,但可借此了解所使用模型在纠正误解方面的可靠程度。该基准的测试数据和代码已公开,可供进一步验证和使用。

一项新研究提出了FPCO-Dialog,一个用于评估视觉语言模型在多轮对话中面对重复错误前提时的纠正与合作行为的基准。该基准包含1080张图像和10800个问题回合,按视觉复杂性、物体类别和错误前提类别分层。

研究评估了20个商用和开源VLM,采用模型无关的协议和CorrTP@K指标——一种衡量错误前提回合纠正率的指标,由两个独立检测器评分。结果揭示了不同模型在总体纠正倾向上的显著且持久的差异,以及模型特定的逐轮动态。

该论文已被EMNLP 2026主会议接收。数据集、评估协议、模型输出、检测器标签和代码均已公开。

信息来源