离线强化学习新方法MPI:在数据支持范围外实现可控策略改进

韩国研究者提出多步近端策略改进(MPI),在D4RL基准上提升TD3+BC、ReBRAC和IQL等基线性能,同时保持近端控制。

AI解读:离线强化学习要解决一个根本矛盾:策略更新必须贴近数据集支持的动作,价值估计才可靠,但真正提升性能往往需要跳出已有行为分布。这篇论文把策略建模为概率流形,将多种离线actor目标统一为单步近端改进(SPI),进而提出多步近端策略改进(MPI)——通过连续重定心的近端步骤,在数据支持范围外实现受控改进,同时在每一步保留近端约束。对使用离线数据的强化学习开发者和研究者来说,MPI是一个即插即用的细化模块,可以在保持可靠性的前提下拓展策略探索空间。实验显示,在D4RL基准上,少量MPI细化就能提升TD3+BC、ReBRAC和IQL等强基线的性能。不过,诊断也表明,在批评者误差较大时,重定心改进的效果会受限;这意味着实际应用需注意批评者模型的质量。

预印本arXiv:2609.03842提出一种离线强化学习的新插件机制——多步近端策略改进(MPI),几何上被解释为概率流形上的隐式梯度流离散化。

论文由Soohyun Choi、Seonvin Cho和Songnam Hong撰写,9月3日提交,共28页、7张图、13张表,标注为预印本,尚未经同行评审。

MPI被设计为即插即用的细化模块,通过连续的重定心近端步骤,允许策略在数据集支持范围外进行可控改进,同时每一步保留近端控制。

方法与核心思想

论文将离线actor更新建模为概率流形上的隐式梯度流离散化,从而将多种离线actor目标统一为单步近端改进(SPI)。

在此基础上,MPI通过组合序列化的重定心近端步骤来实现多步改进,支持确定性策略和对角高斯策略等实际变体。

实验结果与局限性

在D4RL基准上的实验显示,少量MPI细化能够提升包括TD3+BC、ReBRAC和IQL在内的强离线基线在许多任务上的性能。

聚焦的诊断测试进一步区分了重定心细化与固定目标更新调度的作用,并刻画了批评者误差条件下的局限。

论文仅限于摘要信息;完整的实验细节和对照结果需查阅原文。

信息来源