Dude:首个面向论文–代码不一致检测的双检测多智能体系统,F1最高提升 18.7%

ACL旗下EMNLP 2026主会议录用论文提出Dude,通过粒度对齐协商与两阶段显著性过滤,将不一致检测的召回率和精度最高提升 22.8%,F1分数最高提升 18.7%。

AI解读:论文–代码不一致检测依赖单一LLM智能体时,受上下文容量和单向检测视角限制,容易漏报。Dude采用双检测多智能体架构,先用双智能体分别从论文和代码两侧检测,再通过粒度对齐协商和两阶段显著性过滤去伪存真,在真实数据集上将F1最高提升 18.7%。对做复现研究和论文评审的科研人员来说,这项工具能自动筛出论文描述与实际代码不符的部分,减少人工逐行核对的时间,并降低把无关差异误报成错误的概率。目前结果仅来自离线数据集实验,尚未公开部署或API,因此实际接入工作流的体验仍需等作者发布代码或演示后才能验证。

2026 年 9 月 3 日提交至arXiv的论文(arXiv:2609.03416v1)提出Dude,一种面向论文–代码不一致检测的双检测多智能体系统。论文已被EMNLP 2026主会议录用,作者来自香港大学(Weijie Liu、Xiaoxi Zhang等学者)。实验显示,与基线方法相比,Dude在真实论文–代码不一致数据集上的召回率和精度最高提升 22.8%,F1分数最高提升 18.7%。

双检测机制与问题来源

Dude是首个双检测多智能体系统,由Weijie Liu、Running Zhao、Wenhao Yuan、Jinfeng Xu、Zhanfeng Xu、Xiaoxi Zhang、Edith Cheuk-Han Ngai共同完成。论文指出,现有基于单一智能体的大语言模型(LLM)范式在检测论文与代码不一致时,受限于上下文容量和单向检测,导致召回率不佳。

系统设计时发现,论文语言与代码语言在粒度上的不对称会带来过度解释和过度报告的问题,使多智能体的错误报告(假阳性)增加。为此,Dude在设计中引入了粒度对齐协商机制和两阶段显著性过滤机制,用以防止智能体误报不一致。

  • arXiv编号:2609.03416v1(于 2026 年 9 月 3 日提交)
  • 被EMNLP 2026主会议录用
  • 分类:cs.AI和cs.LG

信息来源