研究团队发布IRWOZ 2.0工业人机对话数据集:对话状态追踪准确率大幅提升
新版数据集通过Mistral和Claude-3.5增强生成,将对话数扩展至390个,GPT-2的BLEU-4分数从0.1651提升至0.5604。
AI解读:IRWOZ 2.0的发布解决了工业人机对话系统中数据噪声过大的问题。旧版IRWOZ数据集虽然为工业场景提供了专业标注,但对话状态和表述中存在大量噪声,导致对话状态追踪(DST)的准确率受限。研究人员利用Mistral和Claude-3.5等大语言模型对数据进行了增强生成和质量优化,并加入人工修正,使数据集从原先的规模扩展至390个对话,覆盖装配、交付、定位、搬迁四个工业领域。在DST基准测试中,GPT-2模型的BLEU-4分数从0.1651跃升至0.5604,意味着生成回复的文本质量显著提高。对工业机器人研发团队而言,这意味着他们可以基于更干净的数据训练对话系统,减少噪声干扰,从而提升机器人在真实工厂环境中的指令理解与响应能力。不过,该数据集目前仅提供英文对话,且依赖LLM生成与人工修正的组合,在小语种或专用术语极多的细分场景中或许仍需要额外适配。普通读者无需立即行动,该项研究主要影响的是从事人机交互或工业自动化开发的工程师和研究者。
arXiv上发布的论文介绍了一个改进版工业人机对话数据集IRWOZ 2.0。该数据集由Chen Li和Dimitrios Chrysostomou等人构建,旨在解决原始IRWOZ数据集中对话状态与表述的噪声问题,通过引入大语言模型(Mistral和Claude-3.5)增强生成与质量优化,将对话规模扩展至390条,覆盖装配、交付、定位、搬迁四个工业领域,并进行了人工修正和自动拼写错误清除。截至论文发布,数据集已在IEEE DataPort上公开。
数据集改进方法
根据论文摘要,原版IRWOZ通过领域特定标注改进了工业人机交互(HRI)对话系统,但其初始版本在对话状态和表述中包含大量噪声,限制了状态追踪的准确性。IRWOZ 2.0利用Mistral和Claude-3.5进行大语言模型增强生成,并经过质量细化处理,包括人工修正和自动化错字移除。最终数据集包含390个对话,覆盖装配(Assembly)、交付(Delivery)、定位(Position)、搬迁(Relocation)四个工业领域。
基准实验结果
在对话状态追踪(DST)的基准实验中,IRWOZ 2.0相比原版IRWOZ带来了显著改进。论文报告称,GPT-2模型的BLEU-4得分从0.1651提升至0.5604,表明生成文本的流畅性和与参考的匹配度有大幅提高。该实验依据的是论文摘要中报告的对比数据,未提供更详细的实验设置或消融细节。
公开与获取方式
为支持工业HRI研究,研究团队已在IEEE DataPort公开了IRWOZ 2.0数据集,具体地址为https://ieee-dataport.org/documents/irwoz-20-large-language-model-driven-dialogue-dataset-industrial-robot-conversations。论文还提供了arXiv页面(arXiv:2609.04030)供阅读PDF和HTML版本。