新框架DF-ASR为中文语音识别引入语义感知的逆文本规范化

DF-ASR可同时输出口语转写与可读书面文本,在SpeechIO中文子集上优于开源ASR-ITN系统,并保持提示级输出选择能力。

AI解读:语音识别系统通常需要两种输出:逐字转写和经过逆文本规范化(ITN)的可读文本(如把“二〇二四”转成“2024”)。传统做法是先转写再交给独立ITN模块改写,容易把转写错误放大,尤其是对数字、日期等语义敏感的片段。DF-ASR把这个过程合二为一,通过成对的转写与规范化监督训练,让模型自己判断哪些片段需要规范化,并用ITN-MWER目标在训练时对敏感部分的错误施加更高惩罚。作者还提出了REQUIRE-ITN/FORBID-ITN协议,分别衡量必要规范化和受保护片段的保留情况。在SpeechIO人工标注的中文测试集上,DF-ASR稳定优于开源系统,与闭源强基线相当,且能通过提示控制输出形式。这意味着对中文语音产品开发者而言,可考虑用这一方法减少级联错误并简化流程,但论文尚未公开代码或模型,效果还需在其后续发布中验证。普通用户无需立即采取行动。

arXiv一篇提交至IEEE SLT 2026的论文提出Dual-Form ASR(DF-ASR)框架,让中文语音识别系统能同时输出逐字的“口语形式”转写和经逆文本规范化(ITN)的“书面形式”文本,且后者具备语义感知能力,不再依赖独立的级联ITN模块改写。依据论文摘要,该工作聚焦于数字、日期等对语义敏感的数值表达式的规范化问题。

论文提出的方法与训练流程

论文指出,传统方案先由ASR输出口语形式转写,再由单独ITN组件改写为书面形式,这使得书面形式的ASR-ITN容易受识别错误影响,并将规范化与声学-上下文建模割裂。DF-ASR通过成对的口语形式和书面形式监督扩展模型能力,同时保留提示级(prompt-level)输出形式选择。

成对监督数据由大型语言模型(LLM)驱动的“生成-判断”工作流构建,论文作者未在摘要中指明所用LLM型号,也未公开日期等细节。训练还使用作者提出的ITN-MWER序列级目标,对规范化敏感片段上的错误赋予更高惩罚。

评测协议与结果

为分别衡量“应规范化”与“禁止改写”两类目标,论文引入REQUIRE-ITN/FORBID-ITN协议。在SpeechIO的人工标注中文子集上,DF-ASR一致优于开源ASR-ITN系统,并与强闭源参考保持竞争力;同时能可靠维持口语形式和书面形式输出之间的提示级控制。论文未在摘要中给出具体数值或开源/闭源系统名称。

摘要没有提供其他数据集上的结果、具体测试规模、计算开销或模型参数数量,也未说明是否会有代码或模型发布。更多细节需待论文完整版本。

信息来源