新方法RecurTrace让语言模型通过“循环记忆”提升推理深度,无需增加参数
arXiv论文提出RecurTrace,通过循环记忆注意力与自适应停止机制,在相同计算预算下将MathQA准确率提升至 56.9%,并随模型规模增大增益扩大。
AI解读:语言模型在推理时,如果重复执行中间层的一小部分,可以增加有效推理深度而不增加参数或生成额外文本,但这种“潜在循环”有两个缺陷:每次迭代只能看到上一次输出,无法回顾更早的计算;固定循环次数要么在简单问题上浪费计算,要么在难题上深度不够。RecurTrace用循环自身的轨迹来解决:Loop Memory Attention让每个循环层能沿着循环时间轴关注之前迭代自身的状态,从而“回顾”而不是只依赖最新状态;halting head则读取循环状态并预测是否继续,并通过一个能识别“额外深度何时仍能降低损失”的oracle来监督。在相同循环骨干网络的受控MathQA对比中,RecurTrace达到 56.9% 的准确率,平均循环 2.0 次,比最佳固定循环深度高出 2.2 个百分点(在相同计算条件下);而ACT和PonderNet退化为循环 1 次,CALM仅 54.1%(循环 5.6 次),更强的基线LoopUS-Conf 55.3%(3.2 次)、TaH-Mismatch 55.7%(2.1 次)。此外,在 0.6B、1.7B、4B、8B规模上,RecurTrace比相同预算的微调基线生成准确率更高,增益从 0.6 到 3.4 个百分点,随模型增大而扩大。这项技术对研究者和模型部署者有意义:它能提升模型在数学推理等任务上的表现,而不增加部署时的参数量或token开销,但尚需观察其在真实大规模应用中的稳定性。普通用户无需立即行动,因为这是论文成果,尚未进入产品。
一项arXiv预印本研究提出RecurTrace,一种通过循环记忆与自适应停止提升语言模型推理能力的方法。论文称,在相同计算条件下,该方法在MathQA基准上达到 56.9% 的准确率,优于固定循环深度基线 2.2 个百分点,且无需增加参数或生成额外token。论文于 2026 年 9 月 3 日提交,作者来自Yuxiang Wang、Kunyu Feng等人(机构未在摘要中列出)。
方法核心:两个机制解决循环限制
论文指出,重复执行中间层可以提高语言模型推理能力,但现有方法存在两个设计缺陷:每次迭代只看到前一次输出,无法访问更早的计算;固定循环次数导致简单输入浪费深度,而困难输入又计算不足。RecurTrace使用循环自身的轨迹解决这两个问题。
具体地,Loop Memory Attention允许每个循环层沿循环时间轴关注其之前迭代的状态,使模型能回顾较早计算;halting head读取循环状态并预测是否继续,并通过一个oracle监督——该oracle能识别何时额外深度仍能降低损失。论文称该方法在推理时无需额外参数或生成额外token。
- RecurTrace在受控MathQA对比中,相同循环骨干网络上达到 56.9% 准确率,平均 2.0 次循环;最佳固定循环深度为 54.7%(由 2.2 个百分点的差距推断,但原文未直接给出固定基线数值)。
对比结果:准确率与循环效率
在MathQA基准的受控比较中,RecurTrace的表现优于多个基线。ACT和PonderNet退化为单次循环(即停止循环机制失效),CALM达到 54.1% 但平均循环 5.6 次,效率更低;更强大的基线LoopUS-Conf达到 55.3%(3.2 次循环),TaH-Mismatch达到 55.7%(2.1 次循环)。RecurTrace在准确率和效率上均优于这些方法。
此外,论文报告RecurTrace在 0.6B、1.7B、4B、8B规模的生成任务上,比相同预算的微调基线准确率更高,增益随模型规模从 0.6 个百分点增长到 3.4 个百分点。
- 该结果为摘要内容,依据arXiv摘要,并非完整论文的详细实验数据。