新强化学习算法可自适应划分状态空间,求解无界扩散过程控制问题

arXiv论文提出模型化算法,通过自适应细化离散化在无界连续状态空间中学习,理论遗憾界和数值实验均覆盖多资产均值-方差组合选择。

AI解读:很多现实中的连续决策问题,比如金融中的多资产组合管理或运营管理中的库存控制,状态空间往往是无限的,动作有界,而奖励随状态呈多项式增长。这类问题传统的强化学习算法通常假设状态空间有界或奖励增长受限,直接套用会失效。这篇arXiv论文提出的模型化算法,核心是不再使用均匀网格,而是在估计偏差超过统计置信度时,只对需要的区域做更细的划分,从而在无界环境中平衡探索与近似。作者分析了累积遗憾的上界,它依赖问题时限、状态维数、奖励增长阶数,并定义了一个适用于无界扩散过程的"zooming维度",当状态空间有界时该界退化为已有结果。数值实验包括多资产均值-方差组合选择,验证了算法在高维问题上的有效性。对相关研究者或从业者而言,这意味着现在有了一种理论上保证可学习的无界扩散控制方法,但论文只提供了有限实验,尚未涉及实际交易中的摩擦、成本或模型误设,需要谨慎看待其直接应用潜力。

arXiv上一项研究提出了一种针对受控扩散过程的强化学习算法,适用于无界连续状态空间、有界连续动作和多项式增长奖励的设定,这类问题存在于金融、经济学和运筹学。论文作者为Hanqing Jin、Renyuan Xu、Yanzhao Yang,2025 年 12 月 17 日提交第一版,2026 年 9 月 3 日更新第三版(v3)。

算法与理论

该算法是模型化的,自适应划分联合状态-动作空间。每个划分单元内维护漂移、波动率和奖励的估计量,当估计偏差超过统计置信度时,就细化离散化。这种自适应方案在探索与近似之间取得平衡,从而在无界域中实现高效学习。

理论分析给出了遗憾界,依赖问题时限、状态维数、奖励增长阶数和一种针对无界扩散过程新定义的zooming维度。该界在有界设定下可退化为已有结果,同时将理论保证扩展到更广的扩散类问题。

数值验证

通过数值实验验证了算法的有效性,实验包括多资产均值-方差组合选择等高维问题。

信息来源