研究Apple Machine Learning Research·原文 2026年8月26日本站收录 2026年9月5日

苹果研究提出集成式“扩大再剪枝”流程,提升大语言模型预训练压缩效率

苹果机器学习研究团队提出IDEA Prune集成流程,将扩大模型预训练、结构化剪枝与恢复统一在单一余弦退火学习率调度下,实验显示压缩2.8B模型至1.3B时性能优于传统方法。

AI解读:大语言模型越来越大,但部署时的推理预算有限,剪枝是压缩模型的一种常用手段。过去的研究通常只关注剪枝本身,而忽略了预训练阶段是否该先把模型扩大再压缩。苹果这项研究把“扩大预训练、剪枝、恢复训练”整合成一个流程,用单一的学习率调度统一管理,并设计了一种迭代式结构化剪枝方法,来减少剪枝过程中的知识损失,让模型容量能重新分配到幸存的神经元上。实验是在预训练语料上把2.8B参数的模型压到1.3B并训练到2T token,结果显示这种集成方法比从头训练目标尺寸模型在token效率上更有优势,剪枝后的模型性能也更好。对做模型部署的团队来说,这意味着如果算力和数据预算允许,先训练一个大一点的模型再剪枝,可能比直接训练小模型更划算;但代价是预训练阶段的额外算力投入,而且这套方法目前只展示了2.8B到1.3B这一种尺寸组合,更大规模的情况仍未见公开验证。

苹果机器学习研究团队在一篇新论文中提出名为“IDEA Prune”的集成式“扩大再剪枝”(enlarge-and-prune)流程,主张将扩大模型预训练纳入结构化剪枝的整体考虑,并统一在单一余弦退火学习率调度下完成扩大训练、剪枝与恢复训练。

论文作者包括Yixiao Li、Xianzhi Du、Ajay Jaiswal、Tao Lei、Tuo Zhao、Chong Wang和Jianyu Wang,其中Yixiao Li来自佐治亚理工学院,Ajay Jaiswal来自德克萨斯大学奥斯汀分校,两人在苹果期间完成相关工作。

研究背景指出,大型语言模型的增长带来了推理预算压力,结构化剪枝流程相比从头训练目标尺寸模型在token效率上已被证明具有潜力,但以往工作常忽略扩大模型预训练这一环节。

研究团队在两个关键问题上展开:即便扩大后的模型永远不会部署,预训练一个更大的模型是否仍值得;以及如何优化整个流程以获得更好的剪枝后模型。

实验将2.8B模型压缩至1.3B,预训练使用最多2T token,结果显示集成式方法不仅提升了扩大模型预训练的token效率理解,且剪枝后模型性能更优。

查看原图 · 2880 × 840

信息来源