新强化学习算法TIGPO让长期任务LLM智能体跨策略版本复用历史路径
TIGPO通过跨训练轮次维护持久转换图,并将回访数据与历史探索配对,在ALFWorld和WebShop上超越此前方法。
AI解读:这篇论文解决的是长周期任务中强化学习信号稀疏、难以及时反馈的问题。此前方法只在单次策略更新内建图,丢弃早期策略发现的有效路径,导致小样本下的优势估计不稳定。TIGPO让不同训练阶段的轨迹共同参与当前信用分配,并用回访机制把当前探索和历史探索配对比较,直接在相同任务上衡量策略提升。对训练LLM智能体的研究人员来说,这意味着不需要改变奖励设计就能在ALFWorld等环境中稳定提升性能。不过,论文目前只在两个模拟环境中验证,尚未展示对大规模真实任务的实际提升数据,结论的适用范围仍有限。
arXiv论文(编号2609.03383)提出Temporal Instance-Graph Policy Optimization(TIGPO),一种面向长周期LLM智能体的策略优化方法。论文于2026年9月3日提交,作者为Jinwei Gan。方法将图基信用分配扩展到策略更新之间,通过为每个任务维护持久转换图,让不同策略版本发现的有效转换共同决定当前rollouts的信用。