新研究用自回归语音先验做测试时自适应,提升语音增强在噪声失配条件下的质量
论文提出一种单句话级别的测试时自适应方法,用神经音频编解码器提取的干净语音隐表示训练自回归先验,在推理时最小化与增强语音分布的KL散度,无需标注目标数据。实验在多噪声数据集上显示语音质量一致提升,尤其在训练与测试噪声不匹配时。
AI解读:语音增强模型在训练时见过的噪声类型外,实际环境中遇到新噪声时性能会下降。这篇论文提出的方法不需要重新训练或标注数据,而是在推理时用一段语音本身来微调模型:先用神经音频编解码器从干净语音中提取隐表示,训练一个自回归模型作为“干净语音长什么样”的先验,增强后的语音要与此先验尽量接近。做法是对单句话进行测试时自适应,最小化增强语音分布与干净先验之间的KL散度。对需要部署在多变声学环境的语音助手、助听器或会议系统开发者来说,这降低了适配新噪声场景的标注和重训练成本;但效果取决于先验质量,且按论文摘要,实验只验证了语音质量的改善,未提及实时性,部署时仍需测试延迟。
一篇提交至IWAENC 2026的论文提出一种单句级别的测试时自适应方法:用神经音频编解码器提取干净语音的隐表示来训练自回归先验,在推理阶段通过最小化增强语音分布与该先验的KL散度来正则化预训练语音增强模型。该方法不需要标注的目标数据,实验显示在多个带噪语音数据集上语音质量一致提升,尤其是训练与测试噪声不匹配的情况下。论文代码和音频示例已在线公开,预印本发布于2026年9月3日。