研究:利用线性探针可在LLM解码前检测拒绝行为,加速越狱攻击

一项新研究在LLM中间层激活中发现可解码的拒绝信号,并据此提出更快的越狱搜索方法。

AI解读:这项研究的核心发现是,大语言模型的“拒绝”意图在其生成最终回答之前就已编码在中间层激活中,且可以用线性探针在解码前检测出来。研究者据此开发了Mechanistic AutoDAN,一种在遗传提示搜索中只用部分前向传播和探针评分代替完整模型评估的越狱变体,在保持攻击成功率的同时,将每次迭代的搜索时间最多缩短了72%。这意味着,对于依赖拒绝机制来执行安全策略的模型,其防御并非在最后一层才生效,而是在生成早期就暴露了“可攻击性”,从而被更高效地利用。对于AI安全工程师而言,这意味着现有越狱防护可能低估了攻击者的速度优势,尤其是在更大、更鲁棒的模型上,探针引导的效果反而更明显,提示需要关注中间层的信息泄漏风险。不过,该研究主要在可控的学术评估中验证,其攻击方法对具体商业模型的实际效果尚无公开测试数据,因此尚不能断言现实威胁的严重程度。

arXiv上的一项新研究(编号arXiv:2605.28553)提出,大语言模型(LLM)的拒绝行为可以在解码前通过中间激活进行预测。研究者训练了线性探针,在残差流每个transformer块的激活中进行检测,发现在远早于最后一层的位置,拒绝信号就已线性可解码。

基于这一信号,作者引入了Mechanistic AutoDAN——一种由探针引导的AutoDAN变体,在遗传提示搜索循环中,用部分前向传播和基于探针的评分替代完整的模型适应度评估。在评估的多个模型上,该方法实现的攻击成功率与原始AutoDAN相当,而单次迭代的搜索时间最多降低 72%。

研究还发现,探针引导的有效性随模型规模的增大而提高。结果表明,与拒绝相关的信息可从中间激活中解码,并能在AutoDAN式离散越狱优化循环中充当有效的搜索信号,尤其是在更大、更鲁棒的模型中。

信息来源