新架构CAPA让AI会议代理的沉默率从51.4%降至2.5%

研究团队提出CAPA架构,通过Perceiver、Predictor等模块追踪会议状态,使代理能在正确时机发言,同时将幻觉率控制在0.6%。

AI解读:开会时如果有人缺席,AI代理能否替他发言?此前的研究发现,只靠提示词的代理在51.4%的发言机会上保持沉默,因为模型不知道何时该插话。CAPA架构将会议过程显式建模为状态——每个发言后更新状态,预测对话走向,再决定是否发言和说什么。在137场AMI会议测试中,CAPA将沉默率降到2.5%,有效发言恢复量翻倍(26.1升至52.2),且幻觉率维持在0.6%。这说明明确追踪会议状态比单纯扩大上下文窗口更有效。对普通用户而言,这主要影响远程办公或在线研讨会场景——未来AI代理能更可靠地代表缺席者发言。但目前仍处于实验室原型阶段,评估依赖LLM裁判与人类标注的一致性(Cohen's kappa = 0.71),实际部署还需考虑声音、实时性等条件。

一项发表于arXiv(编号2609.03923)的新研究显示,用于在线会议缺席成员发言的LLM代理常常无法判断何时该开口,在AMI语料库中,仅靠提示词的代理在51.4%的发言机会上保持沉默。研究者提出名为CAPA(Collaborative Agent Predictive Architecture)的架构,使代理在137场AMI会议中能将沉默率从51.4%降至2.5%。该论文已被EMNLP 2026主会接收。

CAPA架构的模块与工作机制

根据论文摘要,CAPA由多个模块组成:Perceiver根据观察到的每一轮对话更新会议状态;Predictor预测对话后续走向;Controller决定是否发言以及提出哪个主张;Generator按照该参与者的风格组织措辞。此外,还有两个评判模块(Judges)根据下一轮真实对话对预测和行动打分,Recalibrator再根据这些评判结果更新会议状态,用于后续决策。

研究还定义了一种评估协议,按轮次衡量代理在真实‘观点单元’周围贡献的“是否在正确时机发言、说了什么”。协议采用受模式约束的LLM作为裁判,其评价与人工标注的一致性达到Cohen's kappa = 0.71。在137场AMI会议中,CAPA将沉默率从51.4%降低到2.5%,有效恢复率翻倍(26.1提升至52.2),幻觉率维持在0.6%。

失败模式的转变与关键因素识别

论文指出,引入CAPA后,错误类型从“错过发言机会”转变为“选择了错误的内容”,而每个残余的近失错误可追溯到架构中某个模块。消融实验表明,真正消除识别差距的关键是显式的会议状态;单纯扩大原始上下文窗口并不能带来同样效果。

信息来源