新基准InSituMeasure显示:24款多模态大模型在真实工业仪表读数任务中最佳准确率仅25.7%

研究团队推出包含2,922个真实工业监控场景的基准数据集,评估多模态大模型在连续值测量上的能力,结果显示模型在数值与单位联合准确率上表现不佳。

AI解读:多模态大模型在通用图像问答上表现强劲,但面对工业仪表读数这种需要精确数值和单位的任务时却力不从心。新的基准InSituMeasure用2,922个真实工业场景测试了24款模型,最好的模型数值与单位联合准确率也只有25.7%,说明视觉语言模型在专业测量场景中远未达到可靠水平。这项研究的意义在于,它指出了问题所在:模型容易受文本提示词的干扰、过度自信,以及真实工业环境中的噪声(如视角偏移、遮挡、环境干扰)影响。对依赖自动读数的行业来说,这意味着目前不能直接让大模型替代人工进行仪表监控。这项研究为改进模型提供了评测依据,也让开发者明确了需要重点解决的方向。普通读者不用立即行动,但工业AI从业者可以据此评估现有模型的能力边界。

一项新研究指出,多模态大语言模型在通用多模态基准上表现优异,但在真实工业仪表连续值读数上仍不可靠。为此,研究团队引入了InSituMeasure基准,包含2,922个真实工业监控场景,覆盖八大类专业工程仪表,并配备密集的仪表属性标注和噪声标签用于故障诊断。

论文(arXiv:2609.04014)于2026年9月3日提交,作者来自上海交通大学等机构。研究显示,在24款先进的多模态大模型中,最佳模型在数值与单位联合准确率上仅达到25.7%,置信度-诊断F1分数为51.8%,凸显了通用多模态能力与可靠现场测量之间的显著差距。

基准构成与评估指标

InSituMeasure专注于评估“情境化测量接地”(situated measurement grounding),即模型在真实工业环境中读取仪表并理解其语义的能力。现有基准将测量任务与真实知识场景隔离,缺乏情境上下文、专业仪器、真实噪声和匹配的诊断标注,从而限制了根因分析。

研究定义了多项评估指标:在预设容差下的数值准确性与单位一致性、对虚假或不可回答任务的拒绝能力,以及模型失败与标注误差因素之间的对齐程度。

  • 数据规模:2,922个场景,覆盖8类专业工程仪表。
  • 标注内容:稠密的仪表属性标注和噪声标签(如混合扰动、视角偏移、遮挡、环境干扰)。

模型表现与失败分析

在24款最先进的多模态大模型中,最佳模型仅实现25.7%的联合数值-单位准确率和51.8%的置信度-诊断F1分数。进一步分析揭示了失败原因:文本诱导的捷径(text-induced shortcuts)、过度自信的响应,以及真实工业噪声的干扰,包括混合扰动、视角偏移、遮挡和环境干扰。

结果表明,尽管模型在通用多模态基准上表现优秀,但在需要连续值精确测量和专业知识的任务上仍存在明显不足。

信息来源