研究:单指标评估会高估LLM鲁棒性,扰动影响需分层检验

arXiv新论文在GPT-2和Qwen2.5上测试六类输入扰动,发现行为、表征、注意力头三层影响各不相同,仅看输出指标可能得出误导性结论。

AI解读:这篇论文针对的是大模型鲁棒性测试的一个具体漏洞:多数评测只看输出对不对,但输出正常不代表模型内部处理没被扰乱。研究者用错别字、词序打乱、对抗性替换等六类扰动,在GPT-2和Qwen2.5上同时观察输出行为、隐藏层几何结构和注意力头反应,发现不同扰动会留下不同的内部痕迹,而这些痕迹单靠输出指标看不出来。对做模型评测或安全测试的人来说,直接含义是:以后判断一个模型是否真的抗干扰,不能只报一个准确率或分数,至少要看行为加表征两层证据,否则可能把内部已被带偏的模型误判为稳健。目前实验规模还小,结论只在GPT-2和Qwen2.5系列上验证,能否推广到更新的大模型仍是未知数,所以普通用户不必根据这篇论文改变使用习惯,但它提示评测基准可能需要升级。

arXiv预印本论文《How Perturbations Propagate: A Multi-Level Analysis of Robustness in Large Language Models》(编号2609.03322v1)研究六类自然与合成输入扰动如何穿过decoder-only语言模型,在输出行为、隐藏状态几何和注意力头功能三个层级传播。作者Dun Li Chan、Emily Liu、Niyathi Allu、Christian Hoang在四个GPT-2和两个Qwen2.5检查点上做行为评估,用中心核对齐和内在维度分析逐层几何,并在GPT-2中检查注意力头响应。

论文摘要指出,不同扰动类型会产生可区分的度量特征,这些特征无法被输出测度完全捕捉,且在所测检查点间只有部分一致。核心发现是:仅基于单一行为或表征指标的鲁棒性声明可能具有误导性,研究结果支持采用多层级评估来观察扰动如何改变语言模型的计算过程。

论文于2026年9月3日提交到arXiv,共12页,含4张图,分类为计算语言学(cs.CL)和机器学习(stat.ML)。

扰动类型与评测方法

研究覆盖六类自然和合成输入扰动,包括错别字、损坏文本、改写词和被打乱的token顺序。论文没有逐一列出每类扰动的具体构造方式,摘要仅说明它们属于naturalistic(自然发生型)和synthetic(合成型)。

作者在解码器架构模型上做多层级分析:行为层面观察最终输出变化;表征层面用中心核对齐(centered kernel alignment)和内在维度(intrinsic dimension)衡量各层隐藏状态的几何漂移;功能层面定位GPT-2中注意力头对扰动的响应。行为实验覆盖四个GPT-2和两个Qwen2.5检查点;注意力头分析只在GPT-2上完成。

关键结果与不一致性

论文报告两个主要结果:第一,copying scores(复制得分)与token替换和打乱条件下的activation patching恢复尤其相关,说明某些内部机制对特定扰动更敏感;第二,在GPT-2中,基于梯度的HotFlip对抗扰动比同等替换率的随机token扰动造成更强的行为和表征破坏,而且这种行为影响在全部六个测试检查点上一致出现。

除HotFlip行为影响外,其余扰动在检查点之间的表征影响只部分一致,意味着不同模型对同一扰动可能有不同内部反应。作者由此得出结论:如果只用输出行为或单一表征指标来评估鲁棒性,可能得到误导性的结论。

信息来源