CoverPruner提出视觉令牌剪枝新框架:以覆盖优化取代“保留高分令牌”

该论文提出训练免费剪枝器CoverPruner,从需求侧问“被剪令牌由谁代表”,在多种视觉语言模型架构上取得最高平均准确率,尤其在高压缩率下增益明显。

AI解读:视觉语言模型处理图像时会把图片切成大量视觉令牌,推理成本高。以往剪枝只看“哪些令牌值得留”,容易留下彼此重复的高分令牌,却可能丢掉某些信息。CoverPruner换了个角度:每删掉一个令牌,都要找到仍存活的原始令牌中“最能代表它”的那一个,把剪枝问题变成“表示覆盖最大化”,并用投影器空间覆盖和轻量第一层注意力探针来落地。这个变化直接降低推理时的令牌数量,让剪枝后保留的信息更完整。论文提到,在多个VLM架构和压缩率下,CoverPruner的平均准确率都优于对比方法,且压缩越激进,优势通常越大。对做视觉模型部署的工程师来说,这意味着可以更低成本运行模型而不显著牺牲效果;对普通用户则无需立即行动,目前是论文方法,距离产品化还有一段距离。

arXiv上的一篇新论文提出CoverPruner,一种无需训练的视觉令牌剪枝器,将剪枝问题重新定义为“表示覆盖最大化”(Representational Coverage Maximization,RCM)。论文称,在多种视觉语言模型(VLM)架构和压缩率下,CoverPruner的平均准确率超过所有对比方法,且压缩越激进,优势通常越明显。该论文已被EMNLP 2026主会接收。

方法与动机

现有视觉令牌剪枝方法大多只问“保留哪些令牌”,这种“保留视角”可能留下冗余的高分令牌,同时让被丢弃的证据没有相近的代表。CoverPruner从相反的“需求侧”出发:一个令牌被删除后,对目标VLM而言,哪个幸存的原始令牌能代表它?

CoverPruner将剪枝形式化为RCM,用查询加权的需求覆盖完整的投影视觉令牌集合,并通过“投影器空间覆盖”和一个轻量的第一层注意力探针来实现。

实验结论与限制

论文在多种VLM架构和压缩率下进行评测,CoverPruner的平均准确率在所有对比方法中最佳,最大增益通常出现在激进压缩(aggressive compression)下。

该论文依据为arXiv摘要(版本v1),尚未提供完整实验设置、数据集细节或与其他方法的详细对比数据。CoverPruner为训练免费方法,不涉及权重更新。

信息来源