利用损失轨迹审计密集标注视频,新方法在EgoPER和Cholec80上检测标注错误优于传统基线

研究提出累计样本损失(CSL),通过训练检查点动态识别视频中的语义错误和时间顺序混乱,在EgoPER上AUC提升最多4.2点。

AI解读:视频理解模型依赖高质量标注,但人工标注很难同时保证标签与画面内容一致,又符合动作的时间顺序。现有用训练动态找错的方法多针对静态图像,对视频标注错误帮助有限。这篇论文提出累计样本损失(CSL),做法是在一批不包含被审计样本的数据上训练多个检查点,然后计算每个待审计帧在这些检查点上的平均损失。如果某帧的标注一直与模型学到的视觉或时间结构不符,损失会持续偏高,据此就可以把这类帧标记为疑似错标。实验在EgoPER和Cholec80两个数据集上进行,CSL对语义错标的检测AUC达到92.0,对时间乱序的检测AUC达到78.5,均明显优于直接用最终检查点损失。对制作视频标注数据集或使用密集标注视频的团队,这意味着可以在训练前低成本筛出可疑样本,减少错误标注对模型的影响。论文尚未公开代码,两类错误的判定阈值也仍需根据具体数据集调整。

一篇发表于arXiv的论文(编号2602.15154)提出用训练检查点的损失轨迹来审计密集标注视频中的标注错误,在EgoPER和Cholec80数据集上优于此前基线。方法名为累计样本损失(Cumulative Sample Loss, CSL),通过计算被审计帧在一组不相交参考集上训练的检查点中的平均条件损失,来标记可能存在的语义错标或时间乱序。该论文尚未发布正式期刊版本,当前为预印本,作者来自罗切斯特理工学院(RIT)等机构。

信息来源