CoMAP框架让语言智能体与世界模型共同进化,在多项基准上提升决策性能
新框架通过闭环交互同步更新世界模型与智能体策略,在具身任务规划等基准中相对基线最高提升16.75%。
AI解读:传统语言智能体的世界模型训练后固定不变,无法适应智能体自身策略变化带来的交互分布偏移;而智能体策略的改进又常依赖外部奖励或验证器,在真实交互环境中难以落地。CoMAP框架让两者闭环协同进化:世界模型为候选动作预测环境反馈,智能体评估反馈可靠性并据此调整动作,随后用新产生的轨迹自我蒸馏更新世界模型。这样世界模型能持续贴合智能体不断变化的交互模式,提升预测准确率和长程决策效果,在具身任务规划、Web导航和工具使用基准上均优于对比方法。对开发者而言,这意味着在不依赖外部奖励信号的前提下可同时改进模型预测与策略决策,尤其适合交互成本高或难以设计奖励的复杂环境;但论文当前仅在学术基准上验证,代码已公开,实际部署效果仍需在具体任务中测试。
国际计算语言学协会EMNLP 2026主会议收录的一篇论文提出CoMAP框架,让语言智能体在决策过程中与世界模型共同进化,以应对智能体策略变化带来的环境交互分布偏移。实验室代码已在GitHub公开。
CoMAP在具身任务规划、Web导航和工具使用三类基准上测试,结果均超过对比基线;例如采用Qwen3-4B模型时相对提升16.75%。论文还分析显示,共同进化循环能随时间提高世界模型的预测准确率,并带来更有效的长程决策。