研究:将智能体轨迹逆向重建为可执行终端环境,生成3.73万个训练环境
Terminal-Universe框架通过回放文件操作恢复工作区,再从轨迹合成新任务,经Qwen3.5-27B微调验证,在终端任务基准上较基线提升11.9至13.8个百分点。
AI解读:终端类代码智能体在运行时留下了大量操作轨迹,但这些轨迹只是单次执行的快照,无法用于后续训练——训练需要的是可执行环境:同一个环境可以反复查询生成多个任务,并给出执行反馈。Terminal-Universe的核心思路是逆向利用轨迹本身:轨迹中记录了工具执行历史和文件操作,因此可以据此还原出智能体操作前的文件状态,再补全缺失文件,重建出一个可运行的工作区。在这个恢复的环境上,既能复现原意图任务,也能合成全新任务,还可以通过挖掘环境间的依赖关系生成跨代码库的查询,或用用户代理模拟多轮交互反馈。研究者用公开的终端智能体轨迹生成了3.73万个环境,并用它们微调Qwen3.5-27B,在Terminal-Bench 2.1和EvoCode-Bench v2上分别提升11.9和13.8个点。这项工作的价值在于将大量已积累但难以直接用于训练的轨迹数据转化为可重复利用的训练资源,降低了构建真实终端训练环境的成本。不过,目前评估仅限于论文给定的两个基准,恢复的环境是否完全忠实于原始环境、在更多模型和真实开发场景下泛化如何,还需要更广泛的验证。对普通开发者和独立开发者而言,这个研究短期内不直接影响日常工具选择,但其方向可能让未来的代码智能体更擅长处理真实的多文件、多轮任务。
arXiv预印本论文(编号2609.04148,发布于2026年9月3日)提出Terminal-Universe框架,利用终端智能体轨迹中记录的工具执行历史,逆向重建可执行环境。该方法应用于公开轨迹后生成 37,300 个任务充分的环境。作者团队包括支付宝(Dayiheng Liu、Fei Huang、An Yang)和清华大学(Yujiu Yang)的研究者,论文发表于cs.AI和cs.CL领域。注意:本报道基于论文摘要,未阅读完整全文。
方法:从单次轨迹恢复环境
论文指出,基于终端的代码智能体日益普及,智能体轨迹已大规模积累,但真实、可执行的环境仍然稀缺。作者认为环境才是智能体后训练真正需要的资源,因为每个环境可反复查询并生成多个可验证任务、提供执行反馈,而轨迹只是单次冻结的演示。
Terminal-Universe的流程是:回放轨迹中记录的文件操作,在每个文件被智能体修改前恢复其状态,生成部分工作区;随后由完成智能体补充缺失文件和依赖。在恢复的工作区上,框架既能重建原始意图任务,也能合成全新任务。
任务扩展沿两个方向进行:广度上,挖掘相关环境之间的有向依赖关系,合成跨工作区、跨代码库的查询,模拟开发者的真实开发场景;深度上,将初始单轮查询扩展为多轮对话会话,通过用户智能体模拟迭代式用户反馈和需求细化。
训练效果与评估
作者将Terminal-Universe应用于公开的终端智能体轨迹,得到 37,300 个任务充分的环境。
使用该语料对Qwen3.5-27B进行监督微调后,模型在Terminal-Bench 2.1上的单轮性能提升 11.9 个点,在EvoCode-Bench v2上的多轮性能(MT@4)提升 13.8 个点。论文中未报告其他基线的对比细节或其他模型的验证结果。