新方法AgentAuditor:把多智能体推理痕迹组织成树状再核对证据,准确率最高提升5个百分点

arXiv论文提出AgentAuditor,用推理树替代多数投票来聚合多智能体输出,在四个多智能体框架上准确率最高提升5个绝对百分点,同时保持token效率。

AI解读:多智能体系统通常靠多数投票来汇总多个大模型的答案,但这种方法在智能体们因共享偏见而犯同样错误时会失效——多数票反而选了错答案。这篇arXiv论文指出多数投票丢弃了推理过程里的证据结构,而AgentAuditor把每个智能体的推理痕迹拼成一棵推理树,在推理出现分歧的节点直接比较各分支的证据来裁决,相当于把全局投票变成局部的证据核对。配合ACPO训练策略让裁决者学会不被误导性的多数意见带偏,论文称在四个多智能体框架和多个推理基准上,比多数投票的准确率最高提升5个绝对百分点,且未牺牲token效率。对正在搭建多智能体应用的研究者或工程师,这意味着聚合层有比投票更可靠的选择;但论文基于摘要,尚未提供复现细节,实际收益需在各自场景中验证后再决定是否替换现有方案。

arXiv一篇论文(编号2602.09341)提出名为AgentAuditor的多智能体输出聚合方法,将各智能体的推理痕迹组织成“推理树”,在分歧节点上比较分支证据来解决冲突,替代多数投票。论文报告,在四个多智能体框架和多个推理基准上,AgentAuditor相比多数投票的准确率最高提升5个绝对百分点,同时保持token效率。该论文于2026年2月10日首次提交,9月3日更新第二版。

方法与结果数据

根据论文摘要,多数投票在“虚构共识”(confabulation consensus)情况下表现脆弱——当智能体共享相关偏见并趋同于同一错误理由时,多数票会选中错误答案。AgentAuditor不再基于频率聚合,而是把智能体痕迹组织成显式表示推理一致与分歧的推理树,并在关键分歧点比较分支级证据,将全局裁决转为高效的局部验证。

  • 论文还提出Anti-Consensus Preference Optimization(ACPO),用证据验证的偏好监督训练裁决者,以降低对误导性多数线索的遵从。
  • 实验覆盖四个多智能体框架和多个推理基准,Aggregation性能一致优于多数投票,最高提升5%绝对准确率,且token效率保持不变。
  • 依据为论文摘要,未包含具体框架名称、基准列表或完整实验细节。

信息来源