研究:将探针输入投影到主成分子集,可显著提升Llama-3.1欺骗检测的跨域泛化

arXiv新研究显示,线性探针在分布外数据上失效的问题,可通过选择训练激活的主成分子集来缓解,性能接近直接在测试分布上训练的探针。

AI解读:线性探针是检测语言模型内部行为和概念的常用工具,但换个数据集常常就失效。这是因为模型权重较大的方向往往编码了源数据特有的表面特征,而非通用的欺骗信号。这项研究在Llama-3.1-8B-Instruct上发现,把输入投影到训练激活的主成分子集上,可以让探针在不同欺骗检测数据集之间迁移,性能几乎赶上直接在目标数据上训练的探针。更有意思的是,他们用LLM裁判给每个主成分打分,选出那些最能体现可迁移欺骗方向的主成分,在Insider Trading Report和Sandbagging两个数据集上分别缩小了基线到理想性能差距的 78% 和 25%。对做安全检测或需要跨领域识别特定行为的人来说,这意味着不必每次都为新数据集重训探针,可以从源头挑选更通用的方向。不过这仍是基于少量数据集的初步结果,实际效果还需在更多任务上验证。

arXiv上一项关于Llama-3.1-8B-Instruct的研究发现,将线性探针的输入投影到训练激活分布的一小部分主成分(PC)上,可以实现跨领域迁移,其性能几乎等同于直接在测试分布上训练的探针。该研究针对 3 个保留的欺骗检测数据集进行泛化测试。

研究者还利用PC的解释性来筛选可迁移的主成分。通过让LLM裁判对每个PC打分,判断其激活最强/最弱的样本是否蕴含可迁移的欺骗方向,再仅基于得分最高的PC训练探针,该方法在Insider Trading Report数据集上缩小了基线到理想性能(oracle)差距的 78%,在Sandbagging数据集上缩小了 25%。

信息来源