VLM驱动的SBS框架提升弱监督密集视频描述性能
韩国研究团队提出Seeing Before Synthesizing方法,利用视觉语言模型先感知再生成,在ActivityNet Captions和YouCook2基准上达到最先进水平。
AI解读:弱监督密集视频描述任务中,模型需要仅凭视频级字幕标注来定位和描述未剪辑视频中的多个事件。以往方法用大语言模型生成过渡事件的辅助字幕,但这些字幕不基于真实视觉内容,且被固定分配到每个事件间隔的固定位置和时长。SBS框架的做法是先用视觉语言模型(VLM)为事件间隔生成逐帧叙述,再从这些叙述的语义变化中检测真正的过渡事件,最后通过融合时间中点和语义变化点来精调事件的时间掩码。结果显示在标准数据集上同时提升了描述和定位的准确率。这项工作的意义在于让模型更聪明地决定在哪里生成引导文本,对视频理解、自动剪辑和内容检索有实际帮助,但目前仍是论文结果,尚不清楚其在真实多样化视频上的泛化能力。
一篇被EMNLP 2026主会长文接收的论文提出了Seeing Before Synthesizing(SBS)框架,用于弱监督密集视频描述任务。该框架通过视觉语言模型(VLM)为事件间隔生成逐帧叙事,并据此检测过渡事件,而不是像现有方法那样用大语言模型合成固定位置的辅助字幕。在ActivityNet Captions和YouCook2数据集上,SBS在描述和定位任务都达到最先进水平。