研究提出“规划即推断”的对偶平坦几何框架,统一线性与非线性奖励下的强化学习求解
该框架通过重置规划过程嵌入规划准则,将可达到的访问测度刻画为对偶平坦统计流形,使时序差分误差获得边际效用估计的解释。
AI解读:这篇arXiv预印本试图为强化学习中的“规划即推断”提供一个更统一的数学底座。传统上,规划与推断的联系多在线性奖励或特定假设下成立,而非线性奖励、或想从学习到的策略里读出更多结构时,这种联系会变脆弱。作者的做法是把规划准则直接嵌进环境动力学——通过一个带重置的规划过程——得到一个叫“访问测度”的平稳分布。这个测度所在的集合是一个对偶平坦统计流形:一面坐标是访问概率,另一面是log-策略,两者用条件熵配对。在这一结构下,规划即推断的推广从线性奖励延伸到访问测度的非线性泛函,且每一步更新只需一次自然梯度步;时序差分误差则被解释为对边际效用的估计。对做强化学习算法设计的人来说,这意味着可能获得一种几何上更干净的推导和迭代方式;对理论神经科学而言,则提供了一种把多巴胺等信号当作边际效用估计的数学语言。该论文目前是预印本,尚未经同行评审,结论还需后续验证。
Nikola Milosevic、Asaki Kataoka、Nicolas Hinrichs、Kenji Doya和Nico Scherf在预印本arXiv:2609.04005 中提出强化学习中occupancy measure的另一种刻画:通过一个重置规划过程把规划准则嵌入动力学,其平稳测度(称为“visitation measure”)成为决策信息几何最自然的表达对象。
论文于 2026 年 9 月 3 日提交至arXiv,归类于人工智能(cs.AI),作者身份与内容依据arXiv摘要页面。
作者声称,可达到的visitation measures构成一个对偶平坦统计流形,其两个仿射坐标系分别为访问概率与log-策略,二者在条件熵下互为对偶。
这一结构被用来将planning-as-inference从线性奖励推广到visitation的非线性泛函:作者称每次迭代只需一次自然梯度步即可求解,并将时间差分误差重新解释为边际效用的估计。