研究:音视频扩散模型存在跨模态“语义泄漏”,注意力路由沿特定路径出错
arXiv新论文提出“注意力三角”框架,发现音频—视频边双向路由并受模型参数偏见塑造,提示词与先验冲突时可能覆盖本意,生成视觉上典型但错误的内容。
AI解读:这篇论文想解释一个实际困扰:当你用文字、声音、画面一起控制音视频生成模型时,模型有时会“跑偏”,生成看似合理但语义不对的内容。作者把文本、音频、视频三条信息流之间的交叉注意力连接称为“注意力三角”,发现音频和视频之间的路径是双向的——声音能影响画面,画面也能影响声音,而且这条路径被模型参数里学到的偏见左右。当你的提示词和模型学过的常见搭配冲突时,跨模态交互可能盖过你原本的条件控制,把语义带向视觉上典型但错误的输出。对普通用户来说,这意味着即使你写了详细提示,模型也可能按它自己的“刻板印象”走;对研究者和开发者,论文提供了一种从注意力中提取信号做诊断的方法,能在推理时干预,让生成更贴合文字和音频的本意,同时尽量不牺牲画质。需要说明的是,这仍是arXiv预印本,结论建立在作者自己实验上,实际效果和适用范围要等同行评审和更多复现。
特拉维夫大学等多机构研究者在arXiv提交论文(编号 2609.03586v1),分析音视频扩散模型中的跨模态注意力机制,发现该机制会产生系统性的“语义泄漏”:当提示词与模型学到的先验存在冲突时,跨模态交互可能覆盖预期的条件控制,把语义引向“视觉上典型但错误”的结果。作者包括Sagi Polaczek、Noa Kraicer、Gal Metzer、Zhuo Ning、Ali Mahdavi-Amiri、Daniel Cohen-Or和Raja Giryes。论文于 2026 年 9 月 3 日提交,9 月 4 日上线。
“注意力三角”:三条跨模态边,一条双向通路
研究以“注意力三角”为分析框架,即连接文本、音频、视频三条流的三个跨模态注意力边。作者通过探测和分析这些边上的信息路由,考察生成过程中语义如何跨模态分布。
分析显示,音频—视频边上的路由是双向的:音频能影响视频生成,视频也能影响音频生成。这条边由模型参数中编码的偏见塑造,并成为泄漏的主要来源。
作者认为,语义伪影不仅来自注意力扩散到预期目标之外,更来自沿特定通路的、由偏见驱动的结构化交互。依据论文摘要,这类交互会在提示与学习先验冲突时,覆盖原有意向,将语义改道至视觉上典型但错误的方向。
诊断信号与推理时干预
基于这一视角,研究者提取注意力衍生信号,用以展示语义如何跨模态分布与锚定,并把它当作诊断工具:既能分析泄漏,又能在受控条件下主动诱发泄漏。
论文还利用这些信号指导推理时干预,以促使更一致的跨模态对齐。作者称大量实验支持其分析,并显示在保持生成质量的同时改善了语义锚定。
论文摘要被截断,未提供完整实验细节和量化结果,也未说明具体模型架构与数据集。以上描述均依据摘要内容。