研究:大模型预训练中知识与重复的再思考
实验发现,在固定预算下将重复文档的token用于“辅助视图”能提升学习效果,即使对事实回忆任务也有帮助。
AI解读:这项研究基于受控实验,指出单纯的文档重复并非大模型预训练学习的唯一路径:当token预算固定时,把原本用于重复文档的token转去生成“辅助视图”(即知识的另一种表述),反而会提升模型的学习效果——哪怕在事实回忆这类任务上也是如此。这意味着,对LLM预训练而言,语料中天然存在的多样性(同一知识的多种呈现形式)可能是比大量重复更关键的因素。对从事预训练研究的工程师或关注数据配比的研究者,这提供了一个可操作的思路:与其堆叠重复样本(这通常只在较小batch size下才有效),不如在token预算内安排更多对同一知识的不同改写或表示,用同等的算力换取更扎实的知识获取。需要提醒的是,论文强调其结论是在受控实验条件下得到,且辅助视图的魅力不依赖于生成它们的“教师模型”的强度,但实际超大语料上的效果仍需验证;普通读者无需额外行动,这只是预训练方法论层面的一个新假设。
arXiv发表的一项预印本研究,通过控制实验,检验了“辅助视图”(auxiliary views)在大模型预训练中的作用。论文称,把同一知识的重复表述(reformulations)用于训练,在固定token预算下,比单纯增加文档重复能带来更好的学习效果,即使是在事实回忆任务上也如此。作者称,该结论已获EMNLP 2026 Findings接收。
研究要点
作者用“辅助视图”指代知识的重新表述,即同一信息以句子、措辞或结构变化出现的不同形式。论文提出,这类表述在因果上对学习有帮助。
为验证该假设,研究者设计了隔离变量的控制实验。结果呈现出四点:其一,重复(document repetition)对知识获取仍然是必要的;其二,释义(paraphrasing)只在较小的batch size下有益;其三,在token预算不变的前提下,把用于文档重复的token转投给辅助视图,可以提高学习表现——即便在事实回忆这类任务上,这一反直觉的结果也成立;其四,辅助视图的帮助不取决于生成它的“教师”模型强弱,而存在知识层面的限定:在有先验知识缺口时,某些形式的辅助视图(如上下文性、基础性)作用更明显。
机制性解释与论文局限
论文还从机制角度给出解释:辅助视图的影响可通过层级的偏置(layer-wise biases)以及压缩现象体现。综合这些发现,作者认为,辅助视图在预训练语料中天然存在,可能正是数据多样性在预训练中起作用的一个关键原因。
需要指出的是,本文为arXiv上的控制实验研究,依赖的是人工构造的训练语料,尚未在大规模真实语料下验证,也未涉及公开模型或产品。所有结论以论文摘要和内容为准。