LRConv-NeRV:低秩卷积替代稠密 3×3 卷积,视频解码复杂度降 68%

研究者在NeRV解码器末级应用低秩可分离卷积,模型规模缩减 9.3%,码率降低约 9.2%,INT8量化后仍保持接近基线的重建质量。

AI解读:NeRV这种把整段视频编码进神经网络参数的方法,解码器计算量和内存占用一直偏高,难以在算力有限的设备上跑起来。这篇论文的作者选择在解码器最末的卷积层动手,把密集的 3×3 卷积替换成结构化的低秩可分离卷积,并在解码器内部端到端训练。改动只落在最后一级时,解码器复杂度从 201.9 GFLOPs降到 64.9 GFLOPs,降幅 68%,模型体积减少 9.3%,同时码率下降约 9.2%,画质损失很小。对需要把NeRV部署到边缘设备或做后训练量化的开发者来说,这意味着可以用明显更少的算力换取几乎不变的重建质量;但如果为了追求更高效率而把低秩分解推广到更早的解码层,画质会不成比例地变差,研究中没有提供端到端编码延迟或实际芯片上的能耗数据,部署前仍需要用自有数据集验证效果。

arXiv论文LRConv-NeRV提出一种高效视频神经表示(NeRV)变体,将解码器中的稠密 3×3 卷积替换为结构化低秩可分离卷积,端到端训练于解码器架构内部。论文摘要显示,仅对最后一级解码器应用低秩卷积,即可将解码器复杂度从 201.9 GFLOPs降至 64.9 GFLOPs(降幅 68%),模型体积减少 9.3%,同时码率降低约 9.2%,且重建质量损失可忽略。

该论文由Tamer Shanableh发布在arXiv(编号 2603.18261v2),摘要类型为replace-cross。

信息来源