新音频水印框架CRAW声称可抗神经编解码器,用于合成语音溯源

以色列研究人员提出将失真感知训练、注意力池化、感知掩码和纠错码结合,声称在神经编解码器等变换下保持高鲁棒性,代码已公开。

AI解读:生成式语音模型让真假音频越来越难分辨,骗子可能用合成声音冒充他人。现有事后嵌入的水印在音频经过神经编解码器、降噪器等常规处理后会失效,溯源就断了。CRAW的思路是在训练阶段就模拟这些失真(失真感知训练),并利用注意力池化提取关键特征、推理时用感知掩码把水印藏在人耳不敏感的区域,再用纠错码弥补训练中损失的细节。论文声称,它在神经编解码器、降噪器和声码器下达到当前最好鲁棒性,音质与现有方法相当。对做语音生成或内容平台的人来说,这意味着若复现有效,可在压缩或转码后的音频里仍追踪到来源,减少深度伪造欺诈;但该结论出自论文作者自己的实验,尚无第三方实测或真实部署数据,普通用户不需要立即采取行动。代码已公开(github.com/DavidC1212/craw),开发者和研究者可自行验证。

以色列Bar-Ilan大学研究者David Chernin和Ethan Fetaya在arXiv发表论文,提出一种名为CRAW(Codec Robust Audio Watermarking)的音频水印框架,声称能抵抗神经编解码器和降噪器等变换,同时维持高感知质量。论文摘要称,现有事后(post-hoc)水印方法在这些变换下会失效,而CRAW采用失真感知训练、注意力池化、推理时感知掩码结合纠错码的办法,实验显示对神经编解码器、降噪器和声码器具有当前最优鲁棒性,感知质量与现有事后水印方法相当。代码已发布在GitHub上,地址为https://github.com/DavidC1212/craw。

信息来源