新论文:免监督微调的对比课程奖励可教会多模态模型高效使用放大工具

德国UKP实验室提出的方法在V*、HRBench和MME-RealWorld基准上达到与监督微调相当的性能,且无需额外标注或暖启动阶段。

AI解读:多模态大模型(MLLM)在处理高分辨率图像时通常需要学会调用放大工具来观察细节,但以往方法都要先经过大量人工标注的监督微调(SFT)才能教会模型这一行为。这篇论文的核心突破是:用信息论风格的对比奖励(InfoNCE)替代标注,通过逐步增加难度的负样本工具调用作为训练信号,让模型自己学会何时放大、放哪里。实测结果显示,在V*、HRBench和MME-RealWorld三个基准上,该方法性能与监督微调相当且更高效;若直接替换SFT,全面超过基线。对开发视觉Agent的团队来说,这意味着可以省去昂贵的标注数据收集和预热训练阶段,直接训练模型使用工具。不过论文也强调,目前只有合成数据集Muffin&Chihuahua能精确评估模型的放大区域选择能力,真实场景中的泛化效果仍需验证。普通用户无需立即采取行动;研究者可关注其公开代码,在自有任务上测试该奖励函数是否有效.。

德国达姆施塔特工业大学UKP实验室的研究者提出一种免监督微调的多模态大模型放大工具学习方法,论文已被EMNLP 2026接收。该方法在无需任何额外标注或预热监督微调(SFT)的前提下,通过对比课程奖励让模型学会调用缩放工具,在三个基准上达到与SFT相当或更优的效果。

论文作者为Falko Helm和Iryna Gurevych,发布于arXiv(编号 2609.03206)。研究称,此前多数方法需要为模型专门做监督微调,教会其使用放大工具,而新方法用InfoNCE风格的奖励信号替代了人工标注。

该奖励基于课程学习策略,从简单到困难逐步增加负样本工具调用难度,构成对比训练信号。实验在V*、HRBench和MME-RealWorld三个公开基准上进行,结果显示该方法在性能上具有竞争力且更高效;当直接替换SFT时,其性能超过所有基线。

为直接测量模型的放大能力,研究团队引入可扩展的合成数据集Muffin&Chihuahua(M&C)。该数据集由网格图像组成,每个单元格显示松饼或吉娃娃,并带区域标注。研究发现recall(召回率)是与最终任务性能最相关的指标,即放大区域与目标任务区域的重合度越高,最终任务表现越好。

研究代码已公开,供复现使用。

信息来源