新网络控制框架将截止时间感知与演示驱动强化学习相结合

arXiv论文提出Effective Congestion指标和MGA-RL协议,旨在改善动态网络中延迟敏感流量的端到端峰值延迟保障。

AI解读:传统路由以流量量而非紧急程度为指标,强化学习控制器从头训练又慢又不稳,导致学习型网络控制在需要严格时延保障的场景很难落地。这篇论文针对两个障碍提出一套框架:先用截止时间感知的Effective Congestion指标在路由前过滤掉无法按时送达的流量,再用演示驱动的MGA-RL训练协议加快收敛。对做网络控制的研究者,它的价值是把行为克隆、离线强化学习等方法统一到一个训练目标里,可以在部署前用轻量专家轨迹预热模型;需要明确的是,论文目前只给出方法设计,还没有公开真实网络中的端到端性能对比数据,能否达到严格的峰值延迟仍需在真实环境中验证。

arXiv上一项研究提出一种面向部署的网络控制框架,试图解决动态异构网络中延迟敏感流量的端到端峰值时延保障问题,论文于 2026 年 9 月 3 日提交。

论文指出,传统基于流量量的路由指标不捕捉数据包的紧急性,而从零训练的深度强化学习控制器存在样本效率低、训练时间长和早期探索波动的问题,阻碍了学习型网络控制在实际中的应用。

为此,作者提出截止时间感知的Effective Congestion(EC)指标族,按数据包紧急程度量化接口拥塞,并主动过滤不可行流量;EC策略被嵌入名为MADRL EC(p*) 的混合架构,结合分布式调度器与集中式强化学习路由器。

EC指标与统一训练目标

论文另一部分引入了一个统一训练目标,将行为克隆、离线强化学习、在线强化学习及离线到在线方案等现有策略学习方法归为其特例,结合实时奖励项、预收集奖励项和策略模仿项。

基于该目标,作者推导出Model-Guided Annealed Reinforcement Learning(MGA-RL)协议,并以Deep Deterministic Policy Gradient(DDPG)为骨干实现,旨在通过演示驱动的训练来泛化传统离线到在线(O2O)方案(摘要指出其利用轻量级轨迹进行预热)。

信息来源