新方法通过离线演化环境难度提升终端AI智能体训练效果

arXiv论文提出环境演化(Environment Evolution)方法,离线逐步增加任务难度,在Qwen3.6系列模型上最高提升18.0个百分点。

AI解读:这篇论文针对终端智能体训练中环境难度不足的问题。随着模型能力增强,从头合成的环境不再具有挑战性,而现有协同演化方法依赖在线采样,难以持续提供学习信号。研究者提出的环境演化方法,通过离线方式逐步加大环境难度,并在训练中按代际调度,从而源源不断地提供挑战。在Qwen3.6-27B和Qwen3.6-35B-A3B模型上,配合简单长程强化学习,性能在Terminal-Bench 2.1上分别提升14.4和18.0个百分点。这意味着,对于训练终端智能体的研究者和工程师,该方法或许能以更低采样成本提升模型表现,尤其是在数据受限或需要持续升级的场景。但需要明确,结果来自论文实验,尚未独立验证,且离线演化可能带来环境分布偏差,实际部署需谨慎评估。

一篇提交至arXiv的论文提出环境演化(Environment Evolution)方法,通过离线逐步增加任务难度,为终端智能体(terminal agents)提供持续学习信号。论文预印本于2026年9月3日发布。

信息来源