新研究提出表征相似性优化,以人类道德分类重构LLM潜在表征以提升对抗鲁棒性

通过直接对齐模型潜在表征与人类道德判断中的原型分类结构,而非监督生成回复,该方法在23个LLM的对抗性评估中一致提升了鲁棒性。

AI解读:这篇论文针对的是大模型安全对齐中的一个具体弱点:现有的对齐方法主要优化模型生成的可见回复,但当有害意图被改写成人类一眼能识破、模型却不熟悉的对抗形式时,模型依然容易上当。研究者从认知科学的原型理论出发,发现人类对道德概念的分类是以典型事例为中心、按相似度梯度进行的,而这种分类结构在23个大模型中普遍很弱,模型常常分不清对立的道德类别,也保留不住类别内部的细微典型性差异,且这种缺陷不随模型参数规模和对齐阶段而消失。他们据此开发了表征相似性优化,直接让模型的潜在表征向人类道德判断所体现的分类结构靠拢,而不是去监督生成结果。在251334条道德标注的匹配实验里,传统的基于行为对齐的方法虽然在回复层面学到了预期的道德判断,但分类结构基本没变,对抗评估下的脆弱性反而增加;而重新组织道德分类后,虽然模型在显式道德判断上的提升较小,但在不同规模和多种对抗基准、攻击策略下都稳定改善了鲁棒性。对研究者而言,这提供了一条不依赖扩大数据或提升算力、而是通过改变内部表征结构来增强安全性的新思路;对普通使用者来说,它意味着将来模型面对那些经过改写的越狱提示时可能更不容易被误导,但目前仍处于论文研究阶段,尚无公开的完整模型或独立复现数据,实际效果和可推广性还需进一步验证。

arXiv论文“Representational alignment yields generalizable safety in language models”提出一种名为表征相似性优化的安全对齐方法,直接让大语言模型的潜在表征与人类道德判断所体现的原型分类结构对齐,而非监督模型生成回复。在23个大模型上的对抗评估中,该方法一致提升了鲁棒性。

研究者来自Lingyu Li、Yan Teng、Yingchun Wang和Xia Hu。论文于2026年9月3日提交至arXiv,编号arXiv:2609.04022,归属计算与语言(cs.CL)和人工智能(cs.AI)类别。

信息来源