PaperScout:将学术论文搜索重构为序列决策的自主体,用PSPO解决多轮训练粒度失配
该代理基于累积检索上下文,动态决定是否、何时以及如何调用搜索与扩展工具,优于结构化检索和RL基线。
AI解读:论文搜索大多按预设流程或固定交互协议组织检索,面对复杂、带条件的查询(如涉及多个主题或迭代细化)时容易失配。PaperScout把搜索改为代理自主的序列决策:它根据已经收集到的检索上下文,自己判断下一步要不要再搜、搜什么、怎么扩展,不再依赖预设步骤。这项工作的关键是训练方法——普通强化学习按token粒度优化,而多轮代理交互是序列级的,两者粒度不匹配会导致奖励分配混乱和训练不稳,因此团队提出PSPO,把优化对齐到序列级。这对做检索系统或智能代理的研究者有用,意味着可以用更普适的训练范式来优化多轮检索代理,而不再需要把查询模式硬编码成固定流程。局限在于,性能优势目前只在论文中报告的人工与真实基准上验证,且方案针对论文搜索场景,尚未见大规模外部实测数据。
arXiv:2601.10029v3于 2026 年 9 月 3 日更新,提出了PaperScout,一个将学术论文搜索视作序列决策过程的自主体。与静态工作流不同,PaperScout基于累积的检索上下文,动态决定是否、何时以及如何调用搜索和扩展工具。
训练此类代理面临粒度失配问题:标准强化学习针对单轮任务设计,以token级优化,难以适配以序列级交互为特征的agentic任务,导致奖励分配噪音大、训练不稳定。为此,团队提出Proximal Sequence Policy Optimization (PSPO),一种过程感知的序列级策略优化方法,使优化与代理—环境交互对齐。
实验在合成和真实基准上进行,结果表明PaperScout在召回率和相关性上均显著优于强结构化检索基线和强化学习基线。