新蒸馏框架ALRA让自回归语言模型预训练蒸馏更关注局部词元关系
arXiv预印本提出Adaptive Local Relational Alignment,在 200M与 500M参数学生模型上分别超过最强基线 0.94 和 0.83 个百分点。
AI解读:ALRA解决的是自回归语言模型知识蒸馏中的一个具体缺陷:传统方法在整个词表上对齐师生模型的下一个词概率,但容易忽略那些同样可能但存在相对偏好差异的词元。该方法让每个预测位置由学生先提出候选词元,再把教师最可能的词元作为锚点一起纳入,并按教师概率分布的广度动态调整候选集大小,同时用两个损失项分别匹配选中区与剩余区的词元相对分布。论文称,在The Pile数据集上随机初始化 200M和 500M参数学生模型进行预训练,平均准确率分别达到 36.62% 和 37.40%,比最强蒸馏基线高 0.94 和 0.83 个百分点,比完全不蒸馏预训练高 2.31 和 2.91 个百分点。对做模型压缩或预训练蒸馏的研究者,这套方法提供了一种可复现的局部蒸馏实现路径;但论文只报告了平均准确率,尚未给出不同基准的详细差异、训练成本或特定任务表现,因此它能否取代现有最佳方案,仍需等待复现和更细粒度评估。普通读者不需要立即行动,这项结果的影响主要作用于开展大模型蒸馏的工程与研究团队。
arXiv预印本提出ALRA(Adaptive Local Relational Alignment),一种针对自回归语言模型logit蒸馏的位置级框架,试图改进传统上在整个词表对齐师生模型下一词分布的不足。论文报告,在The Pile数据集上训练随机初始化的 200M与 500M参数学生模型,平均准确率分别达到 36.62% 与 37.40%。
方法设计
ALRA在每个有效预测位置,由学生提出可能的词元候选集,同时将教师最可能预测的词元作为锚点放入该集合,使所选候选既有学生视角又有教师引导。框架还会依据教师概率在该候选集中的分布广度,相对于当前批次动态调整选入的词元数量。
论文将损失分解为Adaptive Local Divergence与Student-Weighted Pairwise Relational Alignment。前者保留原词表分解的质量匹配项,分别在选中区与剩余区匹配相对词元分布,并用单位系数替代教师质量系数,避免因某区域教师概率低而整体被压低权重;后者对高概率且学生概率差距小的词元对给予更高权重,对概率低或明显分离的词元对降权。
实验结果
论文在The Pile上从零训练 200M与 500M参数学生,分别在九个零样本基准上评测。200M模型平均准确率 36.62%,比最强蒸馏基线高 0.94 个百分点,比无蒸馏预训练高 2.31 个百分点;500M模型平均准确率 37.40%,超出最强基线 0.83 个百分点,比无蒸馏预训练高 2.91 个百分点。