研究发现小规模预训练数据配比实验失准源于“重复不匹配”,提出重复率控制方法
arXiv论文指出,高质量数据稀缺被迫重复时,重复率随训练预算变化导致小规模实验外推失败;单次控制实验用 1/16 token即可将配比误差从 0.85 降至 0.10。
AI解读:这条新闻解释了为何预训练数据配比的小规模实验经常在扩大预算后失效。传统做法是用少量token跑实验,再把最优配比外推到完整训练,但论文发现问题不在规模本身,而在高质量数据太少必须重复使用时,重复率会随着预算增加而变化,从而悄悄移动真正的最优配比——这就是“重复不匹配”。对做预训练的研究者或工程师来说,核心启示是把重复率当作配比优化的显式变量,而不是副作用。具体操作方法是用与目标训练相同的重复率去子采样数据,只跑一个用 1/16 token的实验,就能在双源场景下把配比误差从 0.85 压到 0.10;而不做控制则要跑两到四个不同训练长度,耗费目标预算的 19% 到 94%。但方法并非万能:数据源从两个增加到三个时,单个实验不足以锁定配比,需要两个受控实验(在 757M规模上有效)。目前证据来自Wiki-Text基准和特定模型规模,迁移到更大模型或不同数据分布前仍需验证。
预训练数据混合通常通过运行小规模实验来调优,再外推到目标训练预算,但当高质量数据稀缺且必须重复使用时,这种外推频繁失效。arXiv上发布的一篇论文(编号 2606.07597,EMNLP 2026主会议录用)将失败主因归结为一种“重复不匹配”:高质量数据集较小,其重复率会随训练预算增长而变化,从而在小型代理实验未预期的情况下移动最优混合配比。研究者提出一种子采样程序,通过匹配目标重复率来控制这一效应。
论文在双数据源设置(有限高质量数据加网页抓取数据)中报告:仅用目标token的 1/16 进行单次重复受控实验,即可在Wiki-Text基准上为 1.17B参数模型找到距最优配比 0.10 以内的混合;不做重复控制时,相同实验的误差为 0.85。若不使用重复控制要达到相近精度,则需多个训练水平(horizons),使用两个、三个、四个水平的结果时,分别消耗目标token预算的 19%、44% 和 94%。
当数据源从两个增加到三个时,更大的混合空间需要不止一次实验来约束,但该方法仍然有效:在 757M规模下,仅两个受重复控制的水平即可恢复最优混合,优于那些需要完整双源实验来构建的基线。研究者总结称,重复动力学而非规模本身,决定了小规模混合实验能否泛化;数据重复应在混合优化中被当作一阶变量,而不是有限数据的副产品。