新后训练框架LSR:在线性化子空间中修正已训练神经网络,误差可降一个数量级
arXiv论文提出Linearized Subspace Refinement,通过在固定训练状态下求解低维最小二乘问题,绕过梯度优化的病态限制,在函数逼近、算子学习等任务中实现数量级精度提升。
AI解读:这篇论文针对的是科学机器学习中一个常见却常被忽视的问题:神经网络用梯度法训练到一定精度后就plateau(停滞),研究者往往以为是模型容量不够或数据不足,但作者发现瓶颈可能出在优化过程的数值病态上——即使问题本身是凸二次的,标准迭代优化器也走不到理论最优。他们提出的LSR框架不走梯度下降,而是在已训练模型的局部线性化空间里直接解一个低维最小二乘问题,相当于在模型当前状态的切线方向上找最优修正,绕开了病态带来的数值障碍。实际效果是,在函数逼近、数据驱动的算子学习、物理信息微调以及带噪声的反问题上,LSR常常让误差降一个数量级。对使用者的直接意义是:如果手头已训练好的模型精度不够,不必重新调参或换架构,可以试试这种后处理修正;子空间秩这个参数提供了显式的容量控制,能平衡修正强度、数值稳定性和对噪声的敏感度。不过,论文只展示了学术基准和理论分析,没有给出大规模实际模型的测试数据,所以它能否直接迁移到生产环境中的大模型或复杂任务,仍需进一步验证。
一篇arXiv论文提出Linearized Subspace Refinement (LSR),一种与网络架构无关的后训练框架,通过在固定训练状态的局部线性化模型中求解降维直接最小二乘问题来计算子空间最优修正,从而提升预测精度。作者在摘要中报告,该方法在函数逼近、数据驱动算子学习、物理信息算子微调和带噪声反问题中,经常实现一个数量级的误差降低。
论文由Wenbo Cao(曹文博音译)和Weiwei Zhang(张伟伟音译)撰写,标题为“Linearized subspace refinement framework to expose hidden accuracy in trained neural networks”,提交至arXiv(编号:2601.13989v2),分类为机器学习(cs.LG)。