新方法EASE引入视觉证据过程监督,提升多模态RLVR在感知、幻觉等基准上的得分

EASE将标注证据区域转化为平滑视觉标记目标,仅在高奖励轨迹上引导模型视觉注意力,推理时不需额外标注;在Qwen2.5-VL-7B等三个模型上较DAPO平均提升2.5至3.1分。

AI解读:多模态强化学习(RLVR)只用最终答案的对错作为奖励,模型不知道哪个图像区域支撑了回答,容易靠语言先验或猜测得分。EASE把人工标注的证据区域变成训练时的额外信号,在奖励高的轨迹上引导模型把注意力放到对应图像区域,推理阶段不需要这些标注。论文报告,在Qwen2.5-VL-7B、Qwen3-VL-4B、Qwen3-VL-8B上,相比基线DAPO,EASE在感知、幻觉、视觉数学和多模态推理基准上平均提高2.5到3.1分,并改善了注意力与证据区域的对齐。对研究者和工程师来说,这提供了一种在不改变推理成本的前提下提升视觉定位能力的训练思路,但需注意分数来自论文自报的基准,独立复现和更广模型上的表现还有待验证。

一篇被EMNLP 2026接收的论文提出EASE(Evidence-Anchored Spatial Attention),将视觉证据的过程监督引入多模态强化学习,帮助视觉语言模型(VLM)在训练时关注支撑答案的图像区域。研究者在Qwen2.5-VL-7B、Qwen3-VL-4B和Qwen3-VL-8B上测试,相对基线DAPO,EASE在感知、幻觉、视觉数学和多模态推理基准上的平均得分提高2.5到3.1分。论文于2026年5月29日首次提交至arXiv,9月3日更新第二版(arXiv:2605.30912v2)。

方法细节与适用范围

论文指出,带可验证奖励的强化学习(RLVR)通过优化最终答案产生的结果奖励来改进VLM,但这样的结果奖励不会告诉模型哪些图像区域能证明答案正确。对于需要视觉定位的问题,这种奖励无法区分真正由相关视觉证据支持的回答与基于语言先验捷径或运气猜出的回答。

EASE将标注的证据区域转换成平滑的视觉标记目标,在RL训练期间用于指导回答到图像的注意力,但只在奖励较高的轨迹上应用。这些标注仅作为特权训练标签使用,推理时只依赖原始图像和问题,不需要额外标注。诊断和消融实验显示,EASE能更好地将视觉注意力与标注的证据区域对齐。

  • 作者:Ruina Hu、Chen Wang、Lai Wei、Jionghao Bai、Bin Yu、Weiran Huang、Kai Wang、Yue Wang;论文标题“Attend to Evidence: Evidence-Anchored Spatial Attention Supervision for Multimodal RLVR”。
  • 论文已接收为EMNLP 2026论文,属于计算机视觉与模式识别(cs.CV)和计算与语言(cs.CL)交叉领域。

信息来源