新方法HARP用可学习旋转替代固定Hadamard变换,将2bit LLM量化困惑度一致改善

论文预印本显示,HARP在Llama 1B至70B模型2–4bit设置下持续提升困惑度,Qwen3-8B的2bit实验验证跨架构迁移,并保留部署效率。

AI解读:大模型在低比特(如2bit)量化部署时,激活值离群和权重曲率各向异性会让量化误差放大,导致模型性能急剧下降。以往方法用固定的随机Hadamard变换来“打散”这些异常值,但旋转方向是预设的,不能针对不同层、不同校准数据或不同量化器调整。HARP把这种固定旋转换成可学习的结构化正交处理器,用稀疏蝶形分块等结构表示旋转,并在校准数据上拟合,从而让每个层和硬件后端都能找到更合适的量化基底。论文预印本显示,在Llama 1B到70B模型的2–4bit测试中,HARP均改善了困惑度,其中2bit下的零样本增益最明显;在Qwen3-8B上的2bit实验同样有效,说明它能跨模型系列迁移。实际部署层面,以Llama 2 7B的2bit为例,HARP达到128 tok/s,保留固定Hadamard方法约90%的吞吐量,比FP16快约2.1倍。对需要把大模型塞进内存受限设备(如手机、边缘服务器)的工程师和研究者,这意味着在极低比特压缩下,有可能减少性能损失而不显著牺牲速度。不过,论文目前是预印本,且性能数据主要基于测试集困惑度和吞吐量,未提供下游任务基准或更多架构的验证,所以在生产环境使用前仍需谨慎评估。

来自arXiv的论文预印本介绍了一种名为HARP(Hadamard预处理自适应旋转处理器)的新方法,用于改进大语言模型的极端低比特训练后量化(PTQ)。该方法用可学习的结构化正交旋转替代现有方法中固定的随机Hadamard变换(RHT),在2–4bit设置下对Llama系列模型(1B至70B)一致改善困惑度,并在2bit下取得最明显的零样本增益。

论文并未声称HARP已在生产环境部署,其结论基于校准数据拟合和论文报告的基准测试。作者为Artur Zagitov、Gleb Molodtsov和Aleksandr Beznosikov。

方法与原理

论文指出,极端低比特量化对激活值离群和权重曲率各向异性高度敏感。现有一类基于非相干性的PTQ方法(如固定随机Hadamard变换RHT)能提升量化鲁棒性,但无法根据层、校准分布或量化器调整旋转基底。

HARP将每个旋转表示为稀疏蝶形块正交阶段的乘积,支持通过Mixed-Radix调度处理非2的幂次维度,并初始化为RHT处理器(固定置换后)。该方法仅使用校准数据拟合,能逐层并针对后端调整量化基底,同时保持精确的全精度等价性。

HARP的学习参数仅通过校准数据拟合,无需访问完整训练数据,这使其具备在资源受限场景下应用的潜在可行性,但论文未讨论过拟合或不同校准集规模的影响。

实验与部署性能

论文报告HARP在2–4bit设置下对Llama模型(1B至70B)一致改善困惑度,零样本增益在2bit时最明显。一个2bit的Qwen3-8B实验显示了同样效果,说明该方法不局限于Llama家族。

在部署效率方面,以Llama 2 7B在2bit下为例,HARP达到128 tok/s,保留RHT(142 tok/s)约90%的吞吐量,比FP16(61 tok/s)快约2.1倍。这些数据来自论文报告,未提供其他模型或硬件上的量化结果。

论文为arXiv预印本,尚未经过同行评审。摘要中未提供下游任务(如推理、问答)的具体准确率指标。

信息来源