开源Hugging Face Blog·原文 2026年9月3日本站收录 2026年9月7日

350M参数模型经 100 步GRPO微调,结构化输出准确率提升 7 个百分点

Hugging Face发布公开低成本微调方案:用约 500 样本和 100 训练步,将LFM2.5-350M在IFStruct基准上的通过率从 22.6% 提升至 29.7%。

AI解读:这条新闻的价值在于,它展示了一种极低成本就能让小型语言模型在结构化输出任务上显著变强的方法。结构化输出是让AI按指定格式(如JSON、YAML)返回可解析结果的能力,直接决定模型能否被接入下游业务流程——比如自动填写表单、生成发票、解析日志。此前这类任务通常需要数万条数据和昂贵算力,但这里用约 500 个样本、100 步训练,在一张免费GPU上就能完成。关键变化是:一个 350M参数的模型在IFStruct测试集上通过率从 22.6% 涨到 29.7%,其中JSON格式通过率提升近 14 个百分点,已接近 2B参数的更大模型(33.15%)的水平。这意味着开发者不必只依赖超大规模模型来解决格式问题,小模型配合针对性的奖励信号(奖励正确格式、字段数量和schema校验)也能胜任很多结构化任务。不过要注意,这仍是近 70% 的失败率,模型依旧不擅长所有场景,把普通任务交给它前仍需人工检查。对于想尝试的人,这套流程开源于GitHub,附带可在Colab运行的代码,但需要克隆仓库并按自己数据调整。

Hugging Face博客发布一篇公开指南,展示了如何用约 500 条训练样本和 100 步GRPO(Group Relative Policy Optimization)微调让一个 3.5 亿参数模型在结构化输出基准IFStruct上的表现从 22.6% 提升至 29.7%。该流程依托TRL库实现,并已开源在GitHub。

微调方案细节

指南使用LiquidAI的LFM2.5-350M模型,并搭配LoRA适配器,仅训练约 600 万参数(占模型参数的约 1.66%)。训练数据来自nvidia/Nemotron-RL-instruction_following-structured_outputs,每个提示包含目标JSON Schema和预期字段数,共使用约 500 条样本。

为弥合训练数据与评测数据分布差异,作者对数据做了两类增强:40% 的样本被追加“在围栏代码块中返回输出”的指令;另有 20% 的样本被转换为顶层数组任务,要求输出裸列表并符合规定的条目数。

训练定义了三个奖励函数(格式正确率、字段数量匹配度、Schema校验率),加权组合为 [1.0, 0.5, 2.0]。训练参数包括学习率 5e-5、最大步数 100、每组 8 次生成、温度 1.1、KL惩罚系数beta=0.01,配置在免费版 16GB GPU上即可运行。

评测结果与对比

在相同的llama.cpp/BF16服务环境下,IFStruct 2000条测试样本中的通过率由微调前的 22.6% 提升至微调后的 29.7%。分项来看,JSON格式通过率从 18.0% 提升到 31.9%,裸列表输出从 16.6% 提升到 29.7%,而YAML格式几乎不变(27.2% → 27.5%)。

文章指出,进步主要集中在训练目标覆盖的方面:JSON和裸列表提升明显,而YAML没有专门训练所以变化极小。尽管 29.7% 仍低于Qwen3.5-2B报告的 33.15%,但结果说明轻量任务定向微调可以让小模型接近数倍于自身规模的大模型。

评测中还提到,IFStruct基准发布博客中对LFM2.5-350M报告的分数为 21.1%,而本文本地复测得到 22.6%,两者接近。作者明确说明,该微调流程并非复现IFStruct博客中的强化学习模型,而是为了展示针对任务的小模型微调可以提升性能。

信息来源

Hugging Face Blog原始来源