新方法用真人对话数据训练全双工语音模型,提升轮换自然度
研究提出将轮换控制与语义生成解耦,用真人对话训练轮换能力,用文本对话保持语义,实验显示在提升轮换能力的同时恢复基础模型语义水平。
AI解读:全双工语音对话(双方可同时说话)的难点在于模型既要听懂语义,又要在几十到几百毫秒内判断何时插话、何时等待。此前基于神经有限状态机(NFSM)的方法用合成文本模拟对话,但文本无法还原真人对话中的停顿、重叠等细微时序,导致轮换生硬。这篇论文把两个任务拆开:轮换能力用真实人与人对话训练,语义能力用可配置的人机文本对话维持,中间靠规则把真人对话转成训练所需格式,再用特殊损失函数平衡两类数据。对开发语音助手的团队,这意味着不必依赖大模型生成海量模拟对话,也能获得更自然的打断和接话体验,同时保留原有语义水平。不过论文只报告了训练方法的实验收益,没有公开真实场景下的延迟或用户满意度数据,因此实际产品效果仍需验证。
arXiv一篇EMNLP 2026主会论文提出一种解耦数据训练方法,让基于神经有限状态机(NFSM)的全双工对话模型从真实人与人对话中学习轮换控制,同时用可配置的人机文本对话维持语义能力。作者是Yihang Li和Chenhui Chu,代码和模型已公开。
方法与实验
论文指出,NFSM通过把轮换控制和回复生成串联到同一条因果序列上,用标准的下一token预测目标实现全双工对话,微调成本低且保留语义能力,但其依赖合成文本数据,大语言模型无法忠实模拟真实对话中细微的声学时间动态,限制了轮换的自然度。
研究者提出把两类能力分开训练:轮换能力从真实人与人(HH)口语对话学习,语义行为通过可配置的人机(HA)文本对话塑造。他们设计了一种基于规则的事件引导数据转换方法,通过分类轮换事件并按确定性映射规则将HH对话序列化为FSM磁带,从而实现无需大模型生成标注的可扩展监督。
他们还提出Source-Aware Calibrated (SAC) Loss,用于联合校准状态转换token的长尾分布,并让每种数据源监督其最擅长的能力。实验表明该方法显著提升轮换熟练度,同时恢复基础大模型的语义能力。