新框架LUGL让LightGBM等梯度提升树在强化学习游戏中媲美甚至超越DQN

arXiv预印本提出LUGL方法,通过分离数据收集与模型拟合,使非增量学习器应用于自对弈强化学习,在九种游戏中表现与深度强化学习基线相当或更优。

AI解读:强化学习游戏智能体长期被神经网络主导,一个重要原因是深度网络支持增量学习,能适应自对弈训练中不断变化的数据分布。但梯度提升树(如LightGBM)在表格型监督学习上常胜于神经网络,而游戏状态(离散动作、牌面类别、棋盘位置)恰恰是结构化表格数据。这篇arXiv论文的关键在于:它并非直接让树模型去跑强化学习,而是提出LUGL框架,把数据收集与模型训练拆成两个交替阶段——先让智能体自我对弈,把Q值等更新写入有限的表格,再用这些表格训练一次非增量模型,随后清空表格重复。这样一来,梯度提升树绕开了它天然不擅长应对的分布漂移问题。对做游戏AI或强化学习研究的人,这意味着在部分场景下可以不再默认堆神经网络,改用训练更快、表格数据上通常更强的树模型;对普通读者,这篇论文本身只是学术验证,不构成对现有游戏产品的影响,无需采取任何行动。

arXiv预印本(编号2609.03660)提出LUGL(Local Updates, Global Learning)框架,通过将数据收集与模型拟合分离,使LightGBM等梯度提升树(GBTs)能在自对弈强化学习环境中工作。作者在Tic-tac-toe、Connect-4、Othello和Hex四种完美信息游戏,以及Kuhn's poker、Leduc Hold'em、Liar's Dice、Goofspiel和Flop5 Hold'em五种非完美信息游戏中测试,称其表现与DQN和DeepCFR相当或更优。论文由David Milec、Spyridon Samothrakis、Michael Fairbank和Dennis J. N. J. Soemers撰写,于2026年9月3日提交。

研究动机源自两类方法的对比:作者指出,神经网络(NNs)在强化学习中的主导地位部分源于其增量学习能力,适合自对弈训练的在线非平稳特性;而梯度提升树(如LightGBM)在监督学习的表格数据上被认为是当前最佳方法,通常比神经网络更准确、高效。作者认为游戏状态本质上是表格化的——离散动作、类别化牌面、结构化棋盘位置——因此适合基于树的方法。

LUGL如何工作

论文描述LUGL在两个阶段间交替:局部更新阶段,智能体进行自对弈对局,将Q值、V值、策略或遗憾值以表格形式累积在一个有限表中;全局学习阶段,用该表训练一个函数逼近器,使其泛化到未见过的状态,随后重置表格。这种设计使非增量学习器能够避免直接面对RL中的分布漂移问题。

该方法基于摘要介绍,未提供实现细节或训练超参数。完整实验对比、计算成本及与基线的具体差距需查阅全文。

实验结果与结论

作者测试了四种完美信息游戏(井字棋、四子棋、奥赛罗、六子棋)和五种非完美信息游戏(Kuhn扑克、Leduc德州扑克、吹牛骰子、Goofspiel、Flop5德州扑克),报告显示LUGL在所有这些基准上的表现与DQN(用于完美信息游戏)和DeepCFR(用于非完美信息游戏)相比具有竞争力或更优。

作者由此认为,社区在游戏AI中对神经网络强偏好可能缺乏依据,因为基于LightGBM的智能体在所有测试基准中实现了与深度强化学习相当或更优的表现。该结论的依据是论文提供的实验数据。

发布信息

论文共12页、6张图,分类为机器学习(cs.LG)和人工智能(cs.AI),期刊关联DOI为10.1109/TG.2026.3728111,预计发表于IEEE Transactions on Games。本报道基于arXiv摘要,未能覆盖论文全部实验细节。

信息来源