82M参数泰语TTS模型Wayu-Paxa-TTS-Edge发布,支持端侧运行

泰研究人员用OmniVoice合成数据训练出82M参数泰语TTS模型,无需参考音频即可端侧部署,关键词准确率达Gemini 3.1的85.5%。

AI解读:这项研究的核心是用大模型当老师,把15秒的声音样本扩成海量合成语音,再训练一个82M参数的小模型Wayu-Paxa-TTS-Edge,目的就是绕过"大模型推理贵"和"小模型需要专门录音"的两难。对开发者来说,最大的变化是泰语TTS能直接在手机或嵌入式设备上跑,不用每次请求都调用云端大模型,成本和延迟都能降下来。论文给出的硬指标是:关键词准确率68.2%,达到Gemini 3.1的85.5%;停顿位置准确率91.4%,好于老师OmniVoice的89.9%。但要泼冷水的是,这套方案依赖老师OmniVoice的生成质量,老师不会读的复杂文本、泰语特有的一词多义、声调错误这些问题,学生模型也会跟着错,论文也承认老师能力的局限仍然存在。所以短期看,最适合的是对成本敏感、对准确率要求不是极端的应用,比如语音助手或阅读工具;如果是医疗、法律这些容错率低的场景,还得等进一步优化。

泰国研究团队在一篇预印本论文中发布82M参数的泰语TTS模型Wayu-Paxa-TTS-Edge,该模型完全在合成语音上训练,无需参考音频即可在端侧运行泰语语音合成,关键词准确率为68.2%,达到对比系统Gemini 3.1的85.5%。论文于2026年9月3日提交至arXiv(编号2609.03502)。

训练方法与性能

该研究利用大型语音克隆模型OmniVoice作为可编程数据源,将15秒的简短语音参考转换为紧凑的固定声音学生模型,学生模型完全在合成语音上训练。研究者考察了文本准备、合成生成、质量过滤、拒绝采样和前端选择对最终学生模型的影响。

评估指标包括CER、挑战集关键词准确率、韵律停顿准确率、说话人相似度和语速。Wayu-Paxa-TTS-Edge的停顿精度为91.4%,优于其教师OmniVoice的89.9%,达到Gemini 3.1的94.8%;在泰语和英语上的CER分别为3.7%和1.1%,并在三个系统中实现了最低的停顿放置错误和词内停顿率。

  • 模型参数量:82M
  • 关键词准确率:68.2%(Gemini 3.1的85.5%)
  • 停顿精度:91.4%(OmniVoice为89.9%,Gemini 3.1的94.8%)
  • CER:泰语3.7%,英语1.1%
  • 开源:模型和评估框架已开放

泰语特有挑战与局限

论文指出,泰语带来词边界模糊、词汇声调、专有名词和外来词、数字口语化以及泰英代码切换等挑战。研究强调,教师模型的错误会成为训练目标,而过滤失败的生成可能降低困难文本的覆盖率;教师能力的局限仍然存在。

来源仅为论文摘要,具体实验细节和完整结果需查阅全文。

信息来源