R²-MAD框架:用历史辩论经验校准多智能体讨论中的错误共识
arXiv论文提出R²-MAD,通过经验记忆与置信度加权,抑制多智能体辩论中“群体性错误”的放大效应,在多项基准测试中超过现有基线。
AI解读:多智能体辩论看似能提升大模型推理能力,但如果多数智能体一开始就选错了方向,讨论往往会加固错误而不是纠正它,这就是论文指出的“共享误解”。R²-MAD给出的解法很直接:让每个智能体把过去辩论中谁对谁错“记下来”,当团队达成共识时,就检索相似历史案例来修正大家的原始偏见,再根据每个智能体的历史可靠程度来调整它在讨论中的话语权。这样做的意义在于,它不试图让模型“变聪明”,而是改变讨论的游戏规则——让可靠的观点被放大,让历史上容易出错的发言被压低。对研究者和开发“群体智能”应用的人来说,这项技术意味着推理系统在面对没有标准答案的复杂问题时会减少重复犯错;但要注意,实验效果来自多个基准,作者没有公布在真实业务场景下的数据,所以还不能断言它在任何任务上都奏效。
arXiv论文(编号 2609.03619)提出R²-MAD(Remember and Reweight for Multi-Agent Debate)框架,旨在解决多智能体辩论(MAD)中“共享误解”问题:当多数智能体初始就给出错误答案时,辩论过程往往会放大错误而不是纠正它。论文已作为EMNLP 2026 Findings接收,全文 24 页。