新方法InK将神经符号分层强化学习应用于导航任务,提升样本效率

研究提出在分层强化学习中引入可更新的增量知识,通过D*符号规划与神经运动原语结合,在导航任务上显著提升样本效率,并开发了Belief World Tree Search以实现最优规划。

AI解读:传统分层强化学习把知识固定为不可更新的架构选择,导致智能体在稀疏奖励的长时间任务中难以利用探索中获得的新知识,样本效率差。这篇ECML-PKDD 2026论文提出InK方法:高层用D*这样的符号规划器在可更新的增量知识上做规划,低层用条件神经模块学运动原语,从而让规划随探索不断改进。在导航实验中,InK明显提升了样本效率。对做机器人导航或长时程决策研究的开发者来说,这套方法直接解决‘前期知识不足时规划低效’的瓶颈,代码已在GitHub公开,可按需复现或借鉴。但它目前只在导航任务验证过,能否推广到更复杂环境仍不清楚,需要更多实验证明。

一篇发表在ECML-PKDD 2026的论文提出神经符号分层强化学习方法InK(Incremental Knowledge),通过让高层用D*符号规划器在可更新的知识表示上决策、低层用神经模块学习运动原语,在导航任务上将样本效率较固定知识的分层强化学习显著提升。论文由Subrat Prasad Panda、Blaise Genest和Arvind Easwaran撰写,代码已公开在GitHub。

信息来源