Meta发布免对齐语音模型Text-AB:3B参数覆盖配音与全双工对话合成

Text-AB基于扩散Transformer和DAC-VAE潜空间,宣称压缩率较EnCodec提升超 10 倍,支持一次性约 1 分钟语音生成,通过多扩散方案实现任意长语音合成。

Meta研究团队发布Alignment-Free Text-Audiobox(Text-AB)系统,定位为统一的高质量语音配音与全双工对话合成框架。论文称Text-AB在三个方向上区别于现有Audiobox系统:采用 48kHz波形编码为 25Hz潜序列的DAC-VAE特征,压缩率较此前EnCodec表示超过 10 倍,同时提升重建质量;通过现成文本编码器输入原始文本并借助跨注意力学习文本-语音对齐,免除强制对齐和显式时长预测;将模型与数据规模大幅扩展。该系统预训练模型参数为 3B,使用 48 万小时单语语音数据,并在三个下游任务上监督微调:跨语言配音、全双工对话合成和情绪化全双工对话合成。论文于 2026 年 9 月 3 日提交至arXiv(编号 2609.03992)。

推理能力与评测表现

在推理方面,Text-AB支持一次性生成约 1 分钟语音,并能通过一种多扩散方案实现任意长度的长文本生成;此外,系统还加入基于自动化指标的多阶段重排序策略以提升输出质量。

论文报告了多项评测结果:在真实世界的配音基准上,Text-AB相对最新的内部配音系统在韵律相似度、音色相似度、自然度和“分享性”(shareability)上均有大幅提升;在短对话场景中,其全双工对话合成效果接近人类录音,而在长对话的拟人度和表现力上明显优于最新的内部模型,并原生建模话轮转换(turn-taking)、回指(back-channeling)和情绪动态。针对情绪化对话合成,添加情绪条件可显著提升情绪对齐与互动质量,优于无条件基线。

  • arXiv论文编号:2609.03992,提交于 2026 年 9 月 3 日,归属计算与语言(cs.CL)及音频与语音处理(eess.AS)方向。
  • 数据与规模:预训练使用 3B参数模型,语音数据量为 48 万小时(单语)。
  • 核心技术:基于流匹配目标的扩散Transformer,潜编码采用DAC-VAE特征(48kHz波形→25Hz序列)。

信息来源