新基准DSB-IFEval测试全双工语音助手从角色推断对话行为的能力
研究团队推出含 1,038 个测试用例的基准,发现不同架构的实时语音系统在遵循隐含指令时表现各异,安全冲突下的行为仍需改进。
AI解读:全双工语音助手(如能实时对话的AI)通常由开发者设定角色(比如“耐心客服”),但现有测试只检查它们是否听懂明确的指令(如“请勿插话”)。新基准DSB-IFEval用 1,038 个场景,测试六种系统能否根据角色和规则推断出合适行为,例如何时该附和、何时该打断。结果显示,不同架构差异明显:像F-Actor这类全双工模型,只给角色信息时遵守度下降 9.7% 和 4.5%,而GPT-Realtime等系统虽能保持角色一致的说话内容,却不擅长随机应变地调整插话和让话时机。这意味着当前系统无法同时做好“理解角色”和“实时行动”两件事。对于开发者,若依赖角色配置,F-Actor等模型可能表现不佳;若需主动行为(如主动提问),当前多数系统仍有局限,且面对安全冲突时难以违抗角色设定。普通用户暂无需行动,但可期待未来助手在复杂社交场景中更可靠。
arXiv预印本论文(编号 2609.03423,提交于 2026 年 9 月 3 日)介绍了一个名为DuplexSpeechBench-IFEval(DSB-IFEval)的新基准,用于评估全双工语音代理在实时口语交互中遵循隐含指令的能力。该研究由Puneet Mathur和Dinesh Manocha撰写,目前处于投稿阶段。
DSB-IFEval包含 1,038 个测试用例,覆盖 8 种不同的助手角色。它评估五种指令遵循条件协议:默认行为、显式行为指令、人物角色隐含行为、人物角色与规则组合条件,以及指令冲突。论文称,现有基准主要通过显式的轮次管理指令来测试行为,而实际部署的代理往往通过角色或人设配置,需要从这些配置中推断出合适的对话行为。
测量方法与主要发现
研究使用两种评分:确定性指令遵循得分(IAS)用于测量实时话语权管理,以及LLM评判的人物一致性得分(PAS)用于衡量与角色一致的内容。论文在六个实时语音系统上进行了测试。
结果显示了架构相关的权衡。F-Actor和PersonaPlex等全双工模型对对话行为是显式说明还是需从角色推断更为敏感,在仅角色条件下,遵循度分别下降了 9.7% 和 4.5%。相比之下,GPT-Realtime、MiniCPM-o和Fun-Audio-Chat在保持角色一致内容方面表现良好,但其话语行为在显式和仅角色指令之间没有适应,并且在若干主动行为上仍受限。
论文还发现,即使系统能可靠地遵循指令冲突中指定的角色准则,在安全冲突下仍难以覆盖这些准则。作者总结称,推断角色暗含的行为、在适当的对话时机执行该行为,以及解决竞争性指令,对全双工语音代理而言仍是三个不同的挑战。