新框架TAD-Align用轮次感知奖励压制多模态多轮对话攻击成功率

研究团队推出MINT-Safe数据集与TAD-Align对齐框架,在Qwen2.5-VL等模型上将攻击成功率降低超 10%,同时提升安全性与有用性。

AI解读:多模态大模型在开放对话中面临的安全威胁,单轮问答评测覆盖不了:攻击者可以拆解恶意意图,在多轮对话里逐步试探、绕过每回合单独看来都无害的安全限制。现有RLHF对齐方法主要针对单轮任务,既无法捕捉跨轮风险,又依赖昂贵的人工偏好标注。这篇论文的解法是先把攻击过程数据化:用多智能体交互配合文生图工具,造出 1 万多条多图对话样本,构成开源数据集MINT-Safe;再据此训练一个轮次感知的对齐框架TAD-Align,让模型在训练时重点修正那些安全表现不稳定、容易被逐轮攻破的对话回合。实验显示,在Qwen2.5-VL-7B和LLaVA-NeXT上,攻击成功率下降超过 10%,安全性与有用性也有提升。对部署多模态客服、教育或创作工具的开发团队意味着,安全测试必须从单轮问答扩展到多轮会话,否则会高估模型的安全边界;对普通用户,这项研究目前不改变任何现有产品行为,无需采取行动。

多模态大语言模型(MLLM)在开放式多轮对话中可能被对手逐步重组有害意图、绕过单轮无法察觉的安全限制,而面向VQA的现有对齐方法与RLHF难以应对跨轮风险。为此,研究者发布开源视觉多轮训练数据集MINT-Safe,并提出对话安全对齐框架TAD-Align。在Qwen2.5-VL-7B-Instruct与LLaVA-NeXT-7B上,该方法使攻击成功率(ASR)下降超过 10%,无害性提升至少 8%,有用性提升至少 13%,同时保持模型通用能力。

数据集与框架设计

MINT-Safe包含 11,270 条多图对话与 500 条拒答VQA对,通过多智能体交互并配合文生图(T2I)工具调用增强构建。该数据集以开源形式发布,用于训练模型识别和抵抗跨轮次的有害意图累积。

TAD-Align采用轮次感知的双目标奖励函数,不同于统一处理所有对话轮次的做法。它基于rollout的安全分数方差,动态识别模型安全行为不一致的轮次,并在优化时自适应地提高这些轮次的权重。

论文已投稿至EMNLP 2026主会,arXiv版本显示为 2026 年 1 月首次提交、9 月更新。作者包括Han Zhu、Jiale Chen、Chengkun Cai等来自多个机构的研究者。

信息来源