训练零门槛框架EditVid统一指令式与参考式视频编辑FiVE准确率78.16
弗吉尼亚理工等机构研究者提出训练无关的视频编辑框架EditVid,在无需微调的情况下同时支持指令引导和参考引导编辑,测试准确率显著领先现有免训练基线。
AI解读:视频编辑工具通常只能处理单一类型的编辑,要么按文字指令改风格、改属性,要么按一张参考图换主体,很难在一个模型里同时做好。EditVid提出了一套完全不需要额外训练的框架,用三种机制分别解决局部连贯、长距离身份保持和编辑范围控制,从而让同一套方法既能做风格迁移、物体插入,也能做换脸、局部修改。它在FiVE基准上的准确率达78.16,比此前最强的免训练方案高出约19个百分点,用户研究也显示51.8%的参与者在与7种对比方法的较量中更偏好EditVid。对普通用户来说,这意味着未来可能不用等待厂商训练新模型,就能在现有扩散模型上获得更多样的编辑能力;但对开发者而言,关键限制在于这些数字来自特定基准,尚未覆盖真实场景的复杂光照与运动,且用户偏好也只是相对统计,不能直接等同于画质完胜。
弗吉尼亚理工大学、维克森林大学等机构的研究者发布论文,提出一个名为EditVid的免训练视频编辑框架,统一支持指令引导与参考引导两类编辑任务。论文于2026年9月3日提交至arXiv(编号2609.04190)。
在FiVE基准上,EditVid达到78.16的FiVE-Acc准确率,而此前最强的免训练基线为58.95;在IVEBench上,EditVid也取得有竞争力的结果。
技术方案
EditVid由三个免训练模块组成:稀疏因果记忆用于保持局部时序连贯性,基于对应关系的注意力后token注入用于维持长距离的身份一致性,软潜空间混合用于控制编辑的影响范围。该方法宣称无需对模型进行任何训练或微调。
- 同一框架支持风格迁移、属性修改、物体插入、部分编辑和主体替换
- 用户研究显示,与7种竞争方法相比,参与者对EditVid的整体偏好率为51.8%
评估与发布
论文作者包括Adheesh Sunil Juvekar、Onkar Kishor Susladkar、Kiet A. Nguyen、Muntasir Wahed、Nabeel Bashir、Xiaona Zhou、Tianjiao Yu、Vedant Shah和Ismini Lourentzou,提交时间为2026年9月3日。
- 论文与实验细节可在arXiv页面查看(arXiv:2609.04190),DOI尚在注册中