开源低延迟语音翻译系统X-Translator:注重说话人声音一致性
上海交通大学等团队发布模块化级联式实时语音翻译系统X-Translator,通过增量分段提交和在线说话人提示管理,应对长句与多人对话中的翻译稳定性与声音一致性问题。
AI解读:X-Translator解决的痛点是:实时语音翻译系统在长对话或多说话人场景下经常出错——说话人还没说完、语音识别结果不稳定,翻译就急着开始,很容易翻错;同时,翻译后的声音往往和原说话人对不上,听感很怪。这个系统用一套会话级控制器把三块现成技术串起来:流式语音识别负责先“听”,机器翻译负责“想”,再交由基于提示的语音合成来“说”,核心是两个机制:一个把不稳定的识别片段攒成适合翻译的完整单位,另一个把每段发言和对应说话人的声音绑定,保证译出来还是那个人的声音。它的实际价值在于:过去这类实时翻译通常依赖闭源商用API,而X-Translator的模块是开放的、成本低且可复现,这对想在自建系统里集成实时翻译、又在意说话人声音一致性的开发者或研究者尤其有用。作者用OpenSTBench基准测试了翻译质量、延迟和声音稳定性,也和商业翻译API做了对比。不过目前只公布了摘要和论文,代码与演示还要等实际链接开放后才能评估,现在不宜急着用它替换你手头的翻译方案。
一组来自上海交通大学等机构的研究者(论文作者包括Yuxiang Zhao、Yichi Zhang、Yanchao An、Yanqiao Zhu、Zhanxun Liu、Yushen Chen、Qixi Zheng、Haina Zhu、Yunchong Xiao、Keqi Deng、Shuai Fan、Kai Yu、Xie Chen)在arXiv发布论文(编号arXiv:2607.17544),介绍了一个名为X-Translator的开源实时语音到语音翻译(S2ST)系统。该系统采用模块化级联架构,结合流式语音识别(ASR)、机器翻译(MT)和基于说话人提示的语音合成(TTS),旨在低成本条件下处理长句与多人对话场景中的口译任务。
系统设计:会话级控制器与两大核心机制
根据论文摘要,X-Translator通过一个会话级运行时控制器(session-level runtime controller)来协调流式ASR、机器翻译和提示条件TTS三个模块的运行。系统使用"增量分段提交"(incremental segment commitment)机制,将不稳定的ASR输出流转换为可供翻译的稳定文本单元;同时,一个"在线说话人提示管理器"(online speaker prompt manager)负责将源语音片段与特定说话人的声音提示绑定,供语音合成使用,从而在翻译语音中保留原说话人的声音特征。
评估方式与定位
论文报告称,研究团队使用OpenSTBench基准评估了翻译质量、语音质量和延迟,并与专有语音翻译API作为行为基线进行对比;此外还测试了长句语音的稳定性、多人对话中的说话人保持能力以及多语言翻译质量。摘要指出,X-Translator旨在为理解面向部署的S2ST系统的实际权衡提供一个开放平台。代码和演示将发布在该论文的GitHub链接中(但摘要未给出具体地址)。该论文的学科分类为音频与语音处理(eess.AS)和人工智能(cs.AI)。