新方法MARSE用连续神经音频编码表示做语音增强,可灵活权衡性能与算力

arXiv论文提出基于掩码自回归的语音增强方法MARSE,在相同DNN、NAC与训练设置下对比多种解码策略,称能实现增强质量与计算成本的灵活取舍。

AI解读:这篇论文针对语音增强任务提出了一种新方法MARSE。以往基于掩码生成模型的语音增强大多把声音先转成离散的编码单元再处理,但近期研究发现,直接用神经音频编码器(NAC)产生的连续表示反而能提升语音质量和可懂度。MARSE正是利用这一思路:它把带噪语音中干净的部分逐帧掩蔽掉,再用连续表示迭代地解码恢复出来。作者在相同的Conformer模型、DAC编解码器以及相同训练条件下,对比了几种不同的解码策略,结果显示MARSE能够在增强效果和计算开销之间按需调节。对做实时语音处理或资源受限设备(如助听器、嵌入式降噪)的开发者来说,这意味着可以根据硬件能力选择更轻量的解码策略,不必牺牲太多质量。不过论文目前只公开了方法和初步结论,实际效果与各策略的具体对比数据需要查阅全文或在线示例才能确认。

arXiv 9月3日发布的一篇论文提出掩码自回归语音增强方法MARSE(Masked Autoregressive Speech Enhancement),该方法使用神经音频编码器的连续潜在表示,通过迭代解码被掩蔽的干净语音帧来完成语音增强。研究在相同DNN(Conformer模型)、相同NAC(DAC编解码器)和相同训练设置下比较了多种解码策略,结果显示MARSE能在增强性能与计算成本之间提供灵活权衡。

信息来源