研究:多模态大模型存在“跨模态安全漂移”,轻量方法SRT可在冻结模型上缓解
一项被EMNLP 2026 Findings接收的研究称,良性文本查询在配上视觉图像后可能携带有害意图,而模型对此类请求的安全拒绝率明显低于显式不安全文本。
AI解读:这篇论文解决的是一个具体的安全漏洞:多模态大模型(MLLM)在处理文本和图像时,一条单独看没有问题的文本,配上一张图片后可能变成有害请求,而模型往往意识不到,拒绝率远低于直接写明的有害文本。作者把这种现象称为“跨模态安全漂移”。他们的做法不是重新训练模型,而是提出一个叫SRT的轻量方法,在冻结(不更新)模型参数的前提下,把处理纯文本不安全内容时产生的安全信号“转移”到视觉输入上,引导模型对图片中的风险线索更敏感。对于使用MLLM API或部署开源模型的开发者,这意味着不用付出高昂的微调成本,就能在保持原有功能的同时减少这类绕过安全机制的风险。不过论文目前只展示在多个基准和模型上的有效性,具体提升幅度和不同模型上的表现差异要以实验数据为准,且该方法需要拿到模型内部表示,实际能否直接套用到闭源模型还需验证。
一篇被Findings of EMNLP 2026接收的论文(arXiv:2609.02082)提出,多模态大语言模型(MLLM)存在一种名为“跨模态安全漂移”(cross-modal safety drift)的安全问题:一条良性的文本查询在结合视觉图像后可能传达有害意图。
作者团队(Tianqi Xiao、Shiyao Cui、Minghao Zhang、Junxiao Yang、Renmiao Chen)的初步研究显示,模型对此类请求的安全拒绝率明显低于对包含显式不安全文本的请求。
论文提出一种名为safety-awareness representation transfer(SRT)的轻量方向细化方法,在冻结MLLM主干的情况下缓解该问题,实验表明SRT在多种跨模态设置下能提升安全性并保持模型效用。
研究方法与发现
研究者先进行了实证分析,识别出具有代表性的不安全响应模式。随后他们解读模型的表示和注意力,发现视觉上的风险线索得到的注意力有限,难以有效触发模型的拒绝机制。
基于“来自不安全文本处理的安全信号可以被转移”这一观察,研究者提出SRT。该方法不需要更新模型主干,属于轻量级方向细化(direction-refinement)技术。
- 论文称实验覆盖多个基准和模型,SRT在多种跨模态设置下均能提升安全性,同时保持效用。
- 代码已发布在https://github.com/cucu220123/safety-awareness。
- 论文版本为arXiv:2609.02082v2,于 2026 年 9 月 3 日更新,所属学科包括多媒体(cs.MM)、人工智能(cs.AI)、计算与语言(cs.CL)及密码学与安全(cs.CR)。