研究:后训练方法决定模型拒绝机制的内部结构,三种方法无一同时满足安全对齐三项要求

arXiv新研究对比三种后训练方法在三个不同架构模型上的表现,发现训练方法会重塑拒绝机制的计算方式,但没有一种方法能同时实现拒绝机制不脆弱、不损害通用能力、可通过小规模编辑修正安全行为。

AI解读:这项研究解释了为什么目前主流的模型安全对齐手段可能不够可靠。研究者用监督微调、带推理链的微调和偏好优化(ORPO)三种方法,分别训练了Llama-3.1-8B、Gemma-2-9B和Qwen3-8B三个不同架构的模型,结果发现训练方法本身会重塑模型内部拒绝有害请求的计算方式——这解释了为何不同模型即使接受类似安全训练,行为表现却可能不同。更重要的是,没有任何单一方法能同时满足安全对齐的三个理想特性:拒绝机制不集中在少数脆弱组件上、安全训练不牺牲通用能力、安全行为可通过小规模定向修改来纠正。这意味着使用安全训练后模型做安全关键任务的开发者,不能只依赖当前的后训练流程作为可靠防线,尤其在大模型安全护栏容易被越狱或定向干预的场景下,需要结合对齐测评、对抗测试和架构层面的安全设计。不过,论文的结论基于 8B规模的三个模型,对更大模型或更复杂安全场景的适用性仍需更多验证。

一项发表在arXiv上的研究(论文编号arXiv:2609.03887)对比了三种后训练方法在三个不同架构模型上的对齐效果,发现训练方法会重塑模型内部拒绝有害请求的计算方式,而没有任何一种方法能同时满足安全对齐的三个理想特性。论文已获EMNLP 2026主会议接收,作者包括Hoang Cuong Nguyen、Mark Dras和Usman Naseem。

信息来源