NVIDIA NeMo 2.7.0发布:新增流式语音翻译与逐流短语增强,未来版本将专注语音任务
NVIDIA发布NeMo 2.7.0,新增逐流短语增强(Per-Stream Phrase Boosting)和流式语音翻译支持,并发布了两款新模型;同时宣布 2.8.0 起移除LLM、NLP等集合,仓库将只保留语音相关任务。
AI解读:NVIDIA的NeMo框架正从通用大模型工具收窄为纯语音工具包。这次 2.7.0 发布带来两个直接推动点:一是流式语音翻译,让模型在说话人还在讲的时候就开始输出译文,适合实时字幕和跨语言通话;二是逐流短语增强,在转写时给特定短语(如品牌名、人名)加权,解决流式识别里专有名词容易被读错的问题。对开发者来说,真正要留意的是 2.8.0 的破坏性变更——LLM、NLP、视觉这些集合会被移除,如果现有项目依赖这些模块,升级前需要先评估迁移或锁定旧版本。此外,新发布的nemotron-speech-streaming-en-0.6b和magpie_tts_multilingual_357m分别针对英文实时识别和多语种语音合成,前者适合低延迟场景,后者支持印地语等新增语言。普通用户目前无需行动;使用NeMo语音API的开发者可以结合这些功能改进识别准确率和交互体验,但迁移工作应等 2.8.0 路线图明确后再做。
NVIDIA于 2 月 5 日发布NeMo 2.7.0(版本号r2.7.0)。更新重点集中在语音领域,包括新增逐流短语增强(Per-Stream Phrase Boosting)和流式语音翻译支持,并发布两款新模型。此外,官方在发布说明中预告,从下一个版本 2.8.0 开始,仓库将移除avlm、diffusion、llm、multimodal、nlp等集合,仅保留语音任务。
新增功能与新模型
2.7.0 在ASR解码(Transducers)中加入了逐流短语增强(Per-Stream Phrase Boosting),允许在流式识别时对特定短语进行加权,以提升准确率。同时,框架新增了对流式语音翻译(Streaming Speech Translation)的支持,相关PR链接包含在发布说明中。
此版本还发布了两款模型:nemotron-speech-streaming-en-0.6b,用于英文流式ASR;以及magpie_tts_multilingual_357m,用于多语种语音合成(TTS)。后者在更新中新增了印地语(hi-IN)支持,并改进了日语g2p片假名重音处理。
仓库范围调整:NeMo 2.8.0起将仅保留语音任务
发布说明明确指出,从NeMo 2.8.0开始将移除以下集合:avlm、diffusion、llm、multimodal、multimodal-autoregressive、nlp、speechlm、vision和vlm。该仓库将专注于语音相关任务:ASR、TTS、说话人分离(speaker diarization)和语音增强(speech enhancement)。这一调整可能影响依赖旧版NeMo中LLM、NLP或视觉功能的现有项目,但具体迁移路径尚未发布。