新方法用不到1/10算力估算LLM最优超参数扩展律,降低大规模调参成本

研究团队提出Power-Law Entropy Search(PLES)方法,在合成基准、真实LLM训练数据拟合的替代模型及实际预训练中,以低于传统网格搜索十分之一的算力收敛到准确的最优超参数扩展律。

AI解读:训练大语言模型时,最优超参数(如学习率、批大小)会随模型规模和数据量变化,而厂商通常只能在小规模上试错再外推,或烧大量算力做网格搜索来精确定标。这篇arXiv论文提出的PLES方法把这个问题变成了多保真度贝叶斯优化任务,它不再针对单一目标找最优配置,而是直接选择那些能最大程度降低扩展律估计不确定性的实验点,并偏好信息量高的小规模实验(论文未公开代码,具体复现条件需进一步确认)。作者在合成基准、基于真实LLM训练数据拟合的替代模型以及实际LLM预训练中测试,PLES都能用不到传统网格搜索和基线方法十分之一的计算预算收敛到准确的扩展律(文中未给出具体节省的算力数值或时间)。对做超参调优的团队来说,最直接的影响是可以用更少的实验次数确定生产规模的配置,省下的资源可用于更多架构或数据实验;不过论文只报告了方法在实验设置内的收敛效果,没有给出对各类任务或更大模型的普适性保证,实际使用时仍需在自有数据上验证。

arXiv论文(编号2609.01431)介绍了一种名为Power-Law Entropy Search(PLES)的方法,用于估算大语言模型训练的最优超参数扩展律。作者包括Zhiliang Chen、Sebastian Ament、David Eriksson、Maximilian Balandat、Bryan Kian Hsiang Low、Eytan Bakshy和Jihao Andreas Lin。

PLES基于多保真度贝叶斯优化,是一种计算成本感知的采集函数。关键设计是搜索能降低扩展律估计整体不确定性的候选配置,而非优化单一目标函数。每一轮迭代中,PLES选择在单位计算成本内最大程度减少扩展律估计不确定性的配置,因而自然偏向信息量大的小规模实验。

论文报告,在合成基准、基于真实LLM训练数据拟合的替代模型以及实际LLM预训练中,PLES均能以不到传统网格搜索及其他基线方法十分之一的计算预算,收敛到准确的最优超参数扩展律。

信息来源