Multiverse Computing提出QAH:4-bit压缩模型在 7/9 基准上超越其BF16原版
Hugging Face博客论文显示,GPT-OSS 120B压缩至 60B并量化到MXFP4后,通过直接蒸馏原始教师模型,在多数基准上超过自身bfloat16版本;与QAT相比训练步数减少约 7 倍且不衰减。
AI解读:压缩再量化的语言模型通常性能下降,行业靠“愈合”步骤恢复能力。Multiverse Computing提出的Quantization-Aware Healing (QAH) 关键改动是:量化后的学生模型直接蒸馏原始的、未压缩的全精度模型,而不是像常见方法那样从恢复后的bfloat16检查点蒸馏——后者因教师本身已有失真而限制了学生上限。在GPT-OSS 120B压缩至 60B、量化到MXFP4的测试中,QAH模型在 9 项基准的 7 项上超过其bfloat16版本,单项最高提升出现在长上下文推理(+7.4)和数学(+5.6)——正是压缩通常损害最严重的能力;它还以一半参数量和约四分之一的权重内存,在LiveCodeBench上超过原 120B教师。实用性上,4-bit模型权重内存约为bfloat16的四分之一,推理算力减半,可部署在更小硬件上。对部署团队而言,QAH意味着 4-bit模型不再是以精度换效率,只要蒸馏对象选择正确,可以同时更小、更便宜和更准确;但模型蒸馏需要访问原始未压缩教师,且QAH在MMLU-Pro和SciCode上仍落后一点,说明并非所有能力都能无损保留。
Multiverse Computing在Hugging Face发布论文《Quantization-Aware Healing: A Practical Recipe for Recovering Compressed, 4-Bit LLMs》,提出量化感知愈合(QAH)方法:对一个已做过结构压缩和 4-bit量化的模型,直接从未压缩的原始全精度模型蒸馏,而不是像常见做法那样从恢复后的bfloat16检查点蒸馏。将GPT-OSS 120B压缩至 60B参数并量化为MXFP4后,该方法得到的模型在 9 项基准的 7 项上超过其自身bfloat16版本,并在LiveCodeBench上超过原 120B教师模型。
现有愈合方法为何在这类场景失效
典型效率管线分三步:压缩结构、量化权重至 4-bit、再“愈合”恢复能力。Matías等依据论文,主流愈合方法是量化感知训练(QAT),即在训练中插入伪量化算子并按任务损失微调;这要求重新运行已昂贵的多阶段后训练(SFT、RLHF、智能体调优),且研究显示训练超过最佳点后可能不稳定。
另一种方法是量化感知蒸馏(QAD),用冻结的全精度教师通过KL散度损失蒸馏量化学生。该方法在仅做量化、不做结构压缩时有效,因为存在同架构的全精度版本可当教师;但当模型同时经历结构压缩(减少层、头、神经元)后,小架构没有独立训练的全精度版本,唯一候选教师是恢复后的bfloat16检查点,而它本身就是原模型的蒸馏近似,以其为教师会把量化学生的上限锁在该检查点水平。
- QAT需重新运行完整后训练流程,成本高、易过拟合。
- QAD依赖“同架构全精度版本教师”的假设,结构压缩后此假设不成立。
QAH方法及其实现
QAH的改动是:蒸馏直接来自压缩前的原始模型,教师与学生无需共享架构——教师为全尺寸全精度,学生为半尺寸并运行在MXFP4。学生只接触教师的输出分布,不接触硬标签,通过logits上的KL散度匹配分布。这样量化不再是愈合后的有损后处理,而是对原始教师的一轮完整蒸馏监督,学生不再补偿量化丢失的信息,而是获取恢复阶段未及时转移的信息。
论文作者称,KL蒸馏让学生匹配固定教师分布后不再漂移,而交叉熵任务损失会持续向硬标签施压,最终侵蚀能力。为支持包含最长 32k token文档的长上下文训练,作者复用了其另一篇高效蒸馏论文中的分块KL散度损失:每次只计算序列的一个片段,不完整构造词表×序列矩阵,使 32k序列能在固定GPU内存内完成愈合训练。作者在博客中说明,教师logits可离线预计算并冻结。
- 学生仅从教师输出分布学习,不接触硬标签。
- 32k长上下文依靠分块KL损失,避免大矩阵占用内存。
- 论文链接指向Hugging Face博客,作者为Multiverse Computing团队。
评测结果:7/9 项超越自身BF16版本
实验对象为GPT-OSS 120B模型,压缩至 60B、bfloat16恢复,再在QAH下重新量化为MXFP4。对比基线是同 60B模型的bfloat16检查点(该架构最好的全精度版本)。QAH模型在 9 项基准中 7 项领先:AA-LCR(长上下文推理)42.7 vs 35.3(+7.4),AIME 2025(数学)76.3 vs 70.7(+5.6),Aider(智能体编程)40.9 vs 38.2(+2.7),τ²-bench(工具使用)61.7 vs 59.4(+2.3),GPQA Diamond(科学)67.4 vs 65.7(+1.7),IFBench(指令遵循)59.9 vs 58.4(+1.5),LiveCodeBench(编程)66.5 vs 65.5(+1.0);落后仅出现在MMLU-Pro(73.8 vs 74.0,−0.2)和SciCode(34.2 vs 35.6,−1.4),差距均不超过 1.4 分。
相比原 120B教师(论文显示也以MXFP4运行),QAH模型在LiveCodeBench上以 66.5 对 66.0 超过教师,在GPQA Diamond上以 67.4 对 69.0 落后 1.6 分;最大差距在AA-LCR(42.7 vs 50.0)。论文称,这是极端长上下文场景,压缩丢失的能力最难恢复。
- AA-LCR提升最大(+7.4),AIME提升 +5.6。
- LiveCodeBench上超过原 120B教师(66.5 vs 66.0)。
- MMLU-Pro与SciCode落后不超过 1.4 分。
对比QAT:收敛更快且不衰减
论文还对比了QAH与QAT:将GPT-OSS 9B量化为MXFP4,跟踪MMLU-Pro、LiveCodeBench、GPQA Diamond平均分随训练步数变化。两者峰值接近,QAH 54.9对QAT 54.6;QAH约 100 步达峰,之后保持稳定,QAT约 700 步达峰并在随后的训练中显著衰减,至step 1,200 时损失近 19 点。
作者称这造成实际部署风险的差异:QAT检查点需要对照留出信号谨慎早停,否则可能部署已开始退化的模型;QAH检查点只要充分训练就可安全服务,因为其不会漂移。论文将此归因于机制差异:KL蒸馏使学生在匹配固定教师后无继续移动的动力,而交叉熵目标持续对硬标签施压并最终侵蚀继承的能力。
- QAH峰值 54.9(约 100 步),QAT峰值 54.6(约 700 步)。
- QAT到 1,200 步时从峰值跌去近 19 分。
- QAH不需要早停调参,QAT需要依靠留出信号早停。
效率收益与适用范围
论文给出的效率数据:4-bit模型权重内存约为bfloat16学生的四分之一;参数减半使每token算力约为 120B教师的一半。作者称对以bfloat16而非 4-bit发布模型的家族,参数与精度双重削减可使每token算力减少约 8 倍。QAH模型运行硬件要求相应降低。
论文以开源模型GPT-OSS和Nemotron家族等为例,说明压缩-愈合管线已是开源发布的常见做法,作者团队自己的Hypernova 60B也依赖该思路。作者未提供QAH在除GPT-OSS之外模型上的数据,也未公开训练成本、数据集组成、硬件配置的具体数值,仅在博客结尾指向论文全文以获取管线细节、分块KL实现和分布式训练结论。
- 4-bit QAH模型权重内存约为BF16版本的 1/4,算力约为 120B教师的 1/2。
- 若源模型是BF16,参数减半加精度减半可使每token算力降至约 1/8。
- 长上下文愈合依赖 32k token的分块KL损失,适用于固定GPU内存预算。