研究:拒绝回答的脆弱几何形状源于拒绝训练,多样化拒绝起始语可提高抗向量消融攻击能力
对OLMo-2-0425-1B-Instruct的案例研究发现,模型拒绝行为的方向与子空间由训练损失决定,重复的拒绝开头使梯度集中,而多样化拒绝开头能提高稳定秩,削弱向量消融攻击的有效性。
AI解读:AI模型通过拒绝训练学会对不安全提问说“不”,但此前研究发现,这种拒绝行为往往只靠极少数几个“方向”撑着——攻击者只要找到并消除这些方向(向量消融攻击),就能让模型失去拒绝能力,而其他功能基本不受影响。这项研究解释了一个关键疑问:为什么安全功能会挤在这么低维的结构里?答案是,这本身就是拒绝训练“教”出来的:模型在训练中反复学习用几乎相同的句子开头拒绝(例如“对不起,我不能……”),梯度就集中到了少数几个方向,形成了脆弱的几何形状。作者在OLMo-2小模型上做了验证,并提出一个“硬化手段”:在训练数据里加入多样化的拒绝起始语,可以提高梯度和激活变化的稳定秩,让这些方向更难被一波消融打掉。对做模型对齐或红队的人来说,这意味着防御向量消融攻击不一定要靠更复杂的机制,改训练数据的多样性就可能有效。不过,这只是单个小模型上的案例研究,效果能多大程度推广到其他模型和攻击方式,还没有公开数据,别急着下结论。
一项针对OLMo-2-0425-1B-Instruct的案例研究发现,语言模型拒绝不安全提问的行为在激活空间中呈现集中、低维结构,且这种结构是拒绝训练本身造成的:由拒绝语句首个token的损失产生的激活更新,直接解释了拒绝方向与拒绝子空间的来源。论文还提出一种可能的“硬化方法”:使用多样化的拒绝开头进行训练,可以提高梯度和激活变化的稳定秩,使拒绝更难被向量消融攻击移除。该论文由Andrey Labunets撰写,2026 年 9 月 3 日更新至v2版本,收录于arXiv:2608.25390。