GPU驻留批量LM求解器将符号回归常量优化提速,使EvoGP在18个问题中恢复10个控制方程

新方法用固定次数CUDA启动批量优化异构表达式树常量,在A100上处理速度达每秒51万棵树;集成后EvoGP在构造问题上从恢复0个方程提升到10个。

AI解读:符号回归常被卡在常量优化这一步:每个候选表达式都要单独调数值系数,计算贵,所以很多GPU加速框架干脆省掉或只做轻量优化,结果就是搜索出的公式精度不够、恢复不了真实方程。这篇论文给出的解法是把Levenberg-Marquardt求解器整体搬到GPU上,用固定次数的CUDA启动同时优化一整批结构各异的表达式树,反向模式自动微分让每次迭代的耗时与每棵树含多少常量无关,还加了一道双精度保护,保证返回的常量不会比初始值差。直接效果是速度大幅提升——在NVIDIA A100上早期种群每秒可处理约51万棵树,GPU饱和配置下吞吐量大约是Operon在64核EPYC 7763上运行的9.9倍,同时精度与双精度参考实现一致。把求解器集成进EvoGP后,端到端搜索在18个人工构造问题中恢复了10个控制方程,而原版EvoGP一个都恢复不出来。对研究者来说,这意味着符号回归框架不再需要为节省算力牺牲常量优化,后续可以用它处理更复杂的表达式搜索任务;但需要留意的是目前结果是论文作者在特定基准上的报告,尚未经过同行评议正式发表,实际效果和适用范围还有待验证。普通使用者无需立即行动,这项进展主要面向符号回归和自动机器学习领域的研究者。

arXiv 9月3日发布的一篇论文提出一种GPU驻留的批量Levenberg-Marquardt求解器,用于树型遗传编程符号回归中的常量优化。作者报告,在NVIDIA A100上,该求解器对早期种群表达式树每秒可处理约5.1×10^5棵树;在GPU饱和的基准配置下,吞吐量约为Operon在64核EPYC 7763上运行的9.9倍,精度与双精度参考实现一致。集成到EvoGP后,端到端搜索在18个人工构造问题中恢复了10个控制方程,而原版EvoGP为0个。论文已被2026年IEEE高性能极限计算大会(HPEC 2026)接收,将发表于IEEE Xplore。

信息来源