新视频压缩框架VoRTeC:基于生成流模型,码率降58%、解码最快达13 FPS@720p

无需访问扩散模型参数即可实现单步解码;相比此前扩散方法比特消耗减少58%,解码速度提升3到197倍。

AI解读:VoRTeC瞄准的是超低码率视频压缩中两种方案的痛点:传统神经压缩会产生模糊,扩散式生成压缩虽画质好但解码慢、时序不一致。它选择绕开扩散模型,改用基础流模型Wan2.1——把视频的压缩表示编码到流轨迹上的位置,再配合多尺度先验,就能在完全不接触扩散模型内部参数的情况下完成单步解码,既保住感知画质,又把解码速度提到480p下32 FPS、720p下13 FPS,耗码量比此前扩散方法低58%。对做实时传输或窄带宽场景的工程人员,这意味着一台普通GPU就能端到端跑接近实时的生成式压缩,而不必为解码等待数秒;但要注意,论文结果是60秒短视频测试集上的对比,且流模型训练仍需大量数据与算力,实际编码端开销和长视频稳定性要等开源或复现后才能验证,现在不必急着改技术选型,可先评估自身场景是否受限于解码延迟。

清华大学等机构的研究者9月2日向arXiv提交论文,提出视频压缩框架VoRTeC,基于生成流模型Wan2.1实现单步解码,在无需访问流匹配网络参数或梯度的情况下,相比此前扩散式生成压缩方法将比特消耗降低58%,解码速度提升3到197倍。

该方法在720p分辨率下达到13 FPS、480p下32 FPS的解码速度。论文作者包括Yichong Xia、Qinhong Wu、Bin Chen、Jinpeng Wang、Zeyuan Chen和Haoqian Wang,预印本编号arXiv:2609.02291。

信息来源