研究提出短窗口滑动学习框架:1-2秒片段识别监控暴力事件,RWF-2000准确率95.25%
韩国研究团队在2025年IEIE秋季会议上发布新方法,用LLM自动标注短片段,提升长视频暴力检测性能。
AI解读:这条新闻的核心是提出了一种更实用的监控暴力检测训练方式。以往训练模型常把视频当作长片段处理,但暴力行为往往在1-2秒内发生,长视频会稀释关键瞬间,而且人工逐帧标注成本极高。新方法先把视频切成1-2秒的短片段,用大语言模型自动生成画面描述来充当标注,既保留了动作的时间连贯性,又省去了大量人力。实验数据是硬证据:在RWF-2000数据集上达到95.25%准确率,在更接近真实监控场景的长视频数据集UCF-Crime上准确率提升到83.25%,说明这种方法不仅快,泛化能力也更好。对安防系统开发者和监控设备厂商来说,这意味着可以更低成本地训练出能实时预警暴力事件的模型,缩短响应时间。不过目前还只是论文成果,没有现场部署数据,实际效果仍需在真实监控环境中验证,普通观众不需要为此采取任何行动。
韩国研究人员提出一种名为“短窗口滑动学习”(Short-Window Sliding Learning)的监控视频暴力检测框架,将视频切成1-2秒的片段训练模型,并在RWF-2000数据集上取得95.25%的准确率。相关论文已被2025年11月27日举行的IEIE(韩国电子与信息工程师学会)秋季会议接收。
方法与实验数据
据论文摘要,与传统长视频训练方式不同,该方法将视频分割为1-2秒的短片段,并利用大语言模型(LLM)自动生成字幕来构建细粒度标注数据集。每个短片段使用全部帧,以保留时间连续性,从而精确识别快速发生的暴力事件。
实验显示,该方法在RWF-2000数据集上达到95.25%的准确率,在长视频基准UCF-Crime上准确率为83.25%,论文作者称这显著提升了长视频上的性能,并验证了其在智能监控系统中的泛化能力和实时适用性。
- 论文作者(按来源顺序):Seoik Jung、Taekyung Song、Yangro Lee、Sungjun Lee(来源未注明所属机构)。
- 论文页面标注5页、2张图,arXiv编号为2511.10866,v2版本提交于2026年9月3日(原v1发布于2025年11月14日)。