27B混合大模型全网络NVFP4 4-bit量化:Gated DeltaNet循环层在W4A4下性能与BF16持平
一篇arXiv论文通过构建Minima量化方案,对Qwen3.8-27B的全部496个线性层(包括此前被排除在外的Gated DeltaNet循环层)应用NVFP4 W4A4量化,在多项基准测试中达到与BF16相当的水平。
AI解读:此前社区对混合架构大模型做4-bit量化时,普遍猜测循环层(如Gated DeltaNet)的误差会随上下文长度累积,因此人为地把这层保留在8-bit或16-bit精度。这篇arXiv论文用实验推翻了这个直觉:研究者把Qwen3.8-27B全部496个线性层都压到NVFP4 W4A4(权重和激活均为4-bit),包括48层GDN和16层attention,得到的模型Minima在困惑度、MMLU-Pro、GSM8K等5项任务上平均仅差BF16约0.52分。对做推理部署的团队,这意味着模型体积可降到17.5 GiB,prefill速度提升14%到19%,而精度基本不受损,等于在多模态或长上下文服务中减少显存占用、降低延迟。但要注意,这是论文的单点结论,量化方案依赖NVFP4的16元素块缩放和特定的校准方法,作者也修复了模块融合时的全局缩放失配问题。普通用户不需要马上做什么,这个结果主要影响那些正在优化自托管模型部署的工程师——他们可以重新考虑是否值得对循环层做混合精度,而不必像之前那样保守。
arXiv预印本论文“Why Gated DeltaNet Survives 4-Bit Quantization”测试了一个常见直觉:混合大模型里的循环层(Gated DeltaNet,GDN)是否必须保持高精度,以防止递归误差随长上下文累积。作者通过构建Minima量化方案——对Qwen3.8-27B全部496个线性层(含GDN)应用NVFP4 W4A4——发现该模型与BF16基线性能相当,且成为比较中最小的(17.5 GiB)和prefill速度最快的(+14-19%)配方。论文发布于2026年9月3日,提供了量化checkpoint。