研究:离线多智能体强化学习中,任务多样性比数据集规模更能提升零样本泛化

arXiv预印本通过四个环境的实验发现,扩展任务多样性可使留出任务的均值表现提升 3.2 倍,并建议优先改变训练分布中的智能体数量。

AI解读:离线多智能体强化学习(MARL)很难泛化到训练时没见过的任务,这限制了模型在真实场景的使用。这篇arXiv预印本基于四个环境(Connector、RWARE、SMAX、LBF)的大规模实验,给出了一个直接可用的结论:与其堆更多数据,不如让训练任务覆盖更多样的情况,尤其是包含不同数量的智能体。研究团队改造了离线序列模型,使其能处理多任务、变长智能体数量的观测和动作空间,然后在留出的测试任务上比较效果。结果显示,这种多任务方法比单任务模型平均提升 3.2 倍,也稳定优于行为克隆基线。对研究者和工程师来说,这意味着在设计离线MARL训练集时,应优先考虑任务多样性而非单纯扩大数据规模,例如在仿真中模拟不同的智能体数量和协作模式。不过,该结论基于特定环境,能否推广到更复杂的现实任务仍需验证,目前数据来自公开预印本,未经同行评审。

一篇于 2026 年 9 月 3 日提交至arXiv的预印本(编号 2609.03667)提出,在离线多智能体强化学习(MARL)中,扩展任务多样性比单纯增加数据集规模更能实现稳健的零样本泛化。该研究称,在Connector、RWARE、SMAX和LBF四个环境中,其多任务方法在留出测试任务上的平均表现比单任务模型提升 3.2 倍,且一致优于强行为克隆基线。作者包括Oussama Hidaoui、Arnu Pretorius等 18 位研究者。

信息来源