上海交大团队提出无水印TTS溯源框架:联合训练鉴别器实现强模型归因

论文提出不嵌入显式水印、通过联合训练TTS模型与鉴别器进行模型归因的新框架,称在提升溯源泛化性的同时保持甚至轻微改善音频质量。

AI解读:语音克隆越来越逼真,深度伪造风险随之上升,但现有溯源手段主要靠给合成语音嵌入水印(在语音或声码器上),这会损伤音质、也容易被伪造攻击。这篇论文换了一条路:不再依赖水印痕迹,而是把TTS生成器和鉴别器放在一起训练,让模型本身学会识别“哪段语音是自己生成的”,从而在源头实现模型归因。对需要审计音频来源的机构或平台来说,这种方法的吸引力在于它不牺牲音质——论文称能保持甚至轻微改善音频质量——同时泛化性更强。但论文目前只是arXiv预印本,只展示了方案与初步结果,代码要等论文被接收才发布,也没有公开可复现的基准对比,所以还谈不上立刻部署。真正的判断要等代码和第三方评测出来,现阶段更适合做技术跟踪,而非落地选型。

上海交通大学团队7月5日在arXiv提交论文,提出一种无显式水印的TTS模型溯源框架:不向合成语音嵌入水印,而是通过联合训练TTS模型与鉴别器实现模型归因,称溯源泛化性显著提升,同时保持甚至轻微改善音频质量。

论文称这是首个面向“无痕强溯源TTS”(watermark-free TTS with strong traceability)的工作,代码将在论文被接收后发布。

方法:放弃水印,转向联合训练

现有溯源方法主要依赖在语音或声码器上嵌入显式水印,论文指出这类方法会降低语音质量,且易受欺骗攻击(spoofing)。

研究者提出替代方案:不使用水印,而是以联合训练方式同时训练TTS模型和鉴别器,使模型归因能力显著提升。作者将这一方向定义为“首个”无痕强溯源TTS工作。

论文状态与发布计划

论文由Yuxiang Zhao、Yunchong Xiao、Yushen Chen、Zhikang Niu、Shuai Wang、Kai Yu、Xie Chen署名,已于2025年7月5日提交至arXiv(编号2507.03887),属于音频与语音处理(eess.AS)及人工智能(cs.AI)方向。

作者计划在论文被接收后发布代码,以便进相关领域研究。摘要未包含具体实验数据或与基线方法的量化对比。

信息来源