新AI文本检测方法SV-Detect:利用冻结语言模型的引导向量提升跨域检测稳健性
arXiv预印本提出基于引导向量的检测器,声称在领域迁移、源模型变化及编辑攻击下保持较强性能。
arXiv预印本(编号2606.07313v2)提出一种名为SV-Detect的AI生成文本检测方法,基于从冻结语言模型隐藏表示中提取的引导向量(steering vectors)来区分人工与AI写作。作者Mikhail Vishnyakov和Tatiana Gaintseva在摘要中称,该方法在分布内和分布迁移条件(跨领域、跨源模型、机器编辑如润色和重写)下均取得较强性能。
方法细节
根据摘要,SV-Detect在每个层构建一个能分离人工与AI生成文本的方向,并将每个输入表示为与其在这些方向上的层面对齐度。之后,一个在这些投影特征上训练的轻量分类器输出最终检测分数。作者指出,模型本身是冻结的,不进行微调。
版本历史显示,该论文2026年6月5日提交初版,2026年9月3日更新为v2,类型为“replace-cross”,表示其被合并或替换。
检测动机与解释分析
作者强调,检测AI生成文本在分布迁移下尤为困难,例如跨领域、跨源模型,以及机器编辑攻击(如润色和重写)。他们提出将检测问题视为表示空间探测问题,并认为引导向量提供了一种简单有效的解决方案。
解释分析表明,学到的方向与可识别的风格线索对齐,并捕获了超出表层特征的额外信号。