无需重训或群体标签:对微调更新做SVD尾部截断可减少模型虚假关联

一项预印本研究提出,直接截断微调权重差分矩阵奇异值分解的尾部,可在几乎不损失任务准确率的情况下缩小模型在弱势群体上的表现差距。

AI解读:微调大模型时,模型在学会任务的同时也会把训练数据里的虚假关联一并学进去,导致在某些小众群体上系统性出错。过去要修正这个问题,通常得重新训练、准备群体标签或构造反事实样本,成本很高。这篇论文提出的办法是在微调完成后,直接对微调带来的权重变化矩阵做奇异值分解,把排序靠后的尾部截掉,不需要上述任何额外资源。作者在三个指令微调模型和四个分类基准上验证,这种后处理能把弱势群体上的表现差距平均缩小,最大可缩至原来的五分之一(CivilComments数据集),而任务准确率损失不到2个百分点。对普通用户来说,这意味着以后部署微调模型时,多一步廉价的权重清洗就可能减少偏见,不必为每个场景都重训模型。不过要留意,这只是预印本,结论尚未经过同行评审,且实验覆盖的模型规模和任务类型有限,效果是否普遍成立还要看后续验证。

一篇提交至ICML 2026 Weight Space Symmetries Workshop的预印本提出,通过对微调权重差分矩阵做奇异值分解(SVD)并截断其尾部,可以在不重新训练、不使用群体标签、也不构造反事实数据的情况下,降低指令微调模型对虚假相关(shortcut)的依赖。作者是Edward Sun和Dmitrii Troitskii,论文于 2026 年 5 月 29 日首次提交,9 月 3 日更新(arXiv:2606.07596v2)。

方法与结果

该方法针对微调更新矩阵 ΔW = W_ft − W_base进行SVD,并截断奇异值排序靠后的尾部(top-k截断)。作者提出,虚假相关对应的响应集中在 ΔW奇异排序的尾部,因此截断尾部可以定向移除虚假相关,同时保留任务知识。作者强调,这一论断是关于截断行为的,而非原始奇异值的分布——原始奇异值在四个数据集上分布广泛且看起来相似,无法直接区分。

实验覆盖三个指令微调模型(参数量 0.5B至 7B)和四个分类基准。结果显示,top-k截断在每个测试单元上均缩小了虚假群体差距(spurious-group gap),任务准确率损失低于 2 个百分点;在CivilComments数据集上,差距最大缩小至原来的 1/5。

对照实验排除了其他解释:在一个只有虚假相关可学的受控边界情形下,模型行为出现了预期的“微调后向基座模型坍缩”;bottom-k截断和random-k截断效果不同,匹配秩的LoRA对照也排除了通用低秩近似或秩约束训练作为原因。

作者解读与论文状态

作者将这一结果视为初步证据,表明 ΔW的奇异基是研究微调所学内容的有效坐标系。论文尚未经过同行评审,目前以预印本形式发布(arXiv:2606.07596,v2),并被ICML Weight Space Symmetries Workshop接收。

论文归属cs.LG(机器学习)类别,DOI为 10.48550/arXiv.2606.07596。

信息来源