NYU团队提出前瞻性输入修正:深层连续时间循环网络的深度梯度衰减得以缓解

研究者开发递归正交滤波器(RQF),其六层网络在原始音频语音命令任务上达到96.09%准确率,仅需3.19万参数。

AI解读:这篇论文解决深层连续时间循环网络训练中的一个具体瓶颈:层数加深时,时间积分虽给网络带来记忆,但会延迟自下而上的信号并削弱自上而下的误差传播,导致梯度随深度衰减、深层难以学习。纽约大学团队提出低成本修正——将每层的自下而上输入改为“前瞻性”输入,通过一个无参数的二抽头更新实现,不改变循环转移或并行扫描;该修正还推广到一般对角状态空间模型(SSM)。其效果是,在空间反向传播(即截断时间梯度)场景下梯度衰减得到缓解。实验显示该干预在RQF、S5、ORGaNICs等多种模型中普遍有效,尤其当用全时反向传播训练时。对需要处理长序列(如Path-X的16,384步)和高维音频的从业者,这意味着可用更小的模型和更少的参数(如3.19万)达到高精度,而无需依赖更大规模架构;在计算资源受限时,前瞻性输入可能是比增加模型宽度或层数更经济的替代方案。但需注意,结果基于公开基准的特定配置,对动态系统中其他类型误差的适用性未验证。

arXiv论文显示,纽约大学研究者提出一种无参数的“前瞻性输入”修正,可缓解深层连续时间循环网络在时间梯度截断(空间方向反向传播)时出现的深度依赖梯度衰减。通过递归正交滤波器(RQF)——一种对角状态空间模型的特例——实验表明,在前瞻性修正下,RQF、S5和ORGaNICs在全时反向传播(BPTT)中的性能均达到或超过非前瞻对照组。

性能方面,一个非残差宽度为32的六层RQF在原始音频语音命令任务(Speech Commands)上达到96.09%准确率,仅使用31.9k参数;宽度为64的六层RQF在16,384步的Path-X任务上达到83.56%准确率。

方法:能量模型推导与前瞻性修正

研究者从能量模型出发推导RQF的动力系统方程,并指出每个RQF是一种带通滤波器,其可学习参数控制调谐频率和带宽。这使得RQF在结构上与生物学中的神经元滤波特性相符。

为应对深层堆叠导致的自下而上信号延迟和自上而下误差衰减,研究者设计了一种无参数的二抽头(two-tap)更新,令每层的自下而上输入具有前瞻性。该更新不改变循环转移或并行扫描(parallel scan),因此可无缝集成到现有对角SSM架构中。

修正被进一步理论化:对一般对角SSM,前瞻性更新能够在空间方向反向传播(即时间梯度被截断时)缓解深度相关的梯度衰减。研究者将这一干预应用到三类模型:RQF、S5(一种对角SSM)和ORGaNICs(一个非线性门控循环网络),并在两种训练条件下评估:全时反向传播(BPTT)和仅空间方向反向传播。

  • 在所有模型和配置下,使用全BPTT时,前瞻性变体均达到或超过非前瞻对照组。
  • RQF被定位为一种参数高效的循环基础结构,尤其在长步长任务中显示优势。

实验结果与规模

具体实验数值突出了RQF的参数效率:宽32、六层非残差RQF在原始音频Speech Commands数据集上达到96.09%准确率,参数量为31.9k;宽64、六层RQF在Path-X任务(序列长度16,384步)上达到83.56%准确率。论文未提供各类模型之间的同配置对比表格,但指出这些结果表明RQF是参数高效的选择。

作者指出,结果中的路径为arXiv:2609.04134,于2026年9月3日首次提交,论文类型为“new”,研究领域涵盖机器学习(cs.LG)、神经与进化计算(cs.NE)以及神经元与认知(q-bio.NC)。

  • 研究由Shivang Rawat, Mirko Morello, Flaviano Morone和David J. Heeger完成。
  • 研究将RQF明确与对角线状态空间模型(SSMs)相联系,并扩展到一般diagonal SSM。

信息来源