LLMZero用树搜索自动寻找RL后训练策略,在GRPO任务上比基线提升9%至140%
arXiv论文提出由LLM智能体驱动的系统LLMZero,通过树搜索在检查点诊断训练病理并提出多参数协调调整。在四个GRPO任务中,其发现策略相对基础模型提升9%–140%,相对网格搜索提升6%–15%,并揭示容量参数与正则化参数在训练中的不对称动态。
AI解读:这篇论文提出的LLMZero系统想解决一个实际问题:强化学习后训练的效果高度依赖数据集,而固定训练计划(所有参数按预设路径走)没法跟上训练过程中动态变化的探索与利用平衡。研究者用树搜索加LLM智能体,在每个检查点诊断训练出了什么问题,再提出一组协调的参数调整。结果在四个GRPO任务上,LLMZero找到的策略比基础模型提升9%到140%,比网格搜索高6%到15%,计算预算受控时稳定跑赢随机搜索。对做训练的人来说,直接价值是省掉手工调参的试错成本——不用靠经验猜哪个阶段该加多少正则化。实验还发现一个规律:容量参数(比如模型规模相关)在各阶段单调增长,正则化参数却来回振荡以应对训练动态变化。这给出一个设计思路:训练计划里容量可以直线走,正则化得留空间动态调。局限是结果只在GRPO这类任务验证,范围还窄;普通读者不需要为它做什么,真正相关的是负责训练策略的工程师,可以把它当自动调参的参考,但论文没给效果数据的公开复现细节,别急着全盘替换现有流程。
arXiv 6月16日发布、9月2日更新的一篇论文(编号2606.18388)提出LLMZero,一个由LLM智能体驱动的系统,用树搜索自动发现强化学习后训练策略。该系统在每个训练检查点诊断病理,并提出协调的多参数调整。在四个GRPO任务上的实验显示,LLMZero发现的策略相对基础模型提升9%至140%,“相对网格搜索提升6%至15%”