研究:向推理模型注入“思考结束”标记不一定能触发干净的回答阶段
一项被EMNLP 2026主会接收的研究发现,“零训练早停”方法注入的结束思考(EoT)标记,并不总能强制大推理模型停止推理,模型可能继续生成类似推理的内容,直至再次生成EoT。
AI解读:这项研究解释了为什么靠外部插入一个“思考结束”标记来缩短大模型推理链并不总是奏效:模型并未真正学会把该标记当作停止推理的指令,而是把它当作普通token,在它之后仍可能继续生成类似推理的内容,直到模型自己再吐出一个EoT才转入回答。作者通过提高模型对该标记的注意力权重(EAB方法),在四个模型、五个基准和两种早停方法上减少了这种“虚假终止”并缩短回答长度。对开发者而言,这意味着依赖显式格式(如think块)控制推理模型有根本局限——格式匹配不等于语义遵从;若要用早停节省token,需要同时考虑输出质量和成本权衡。目前没有公开数据显示EAB对最终答案准确率的具体影响,相关工具属研究阶段,普通用户暂无需改变使用方法。
一项将于EMNLP 2026主会发表的研究指出,在大型推理模型(LRM)的中间点注入“结束思考”(EoT)标记,并不能始终触发从推理到回答的干净转换;模型可能在回答阶段继续生成类似推理的内容,直到它再次自行生成EoT。研究者将这一现象称为“虚假CoT终止”(spurious CoT termination)。
EoT注入并不总能打断推理
链式思维(CoT)推理能提升大型推理模型在复杂任务上的表现,但常产生冗长、冗余的推理过程。近期出现的“零训练早停”方法通过选择中间点来截断这些推理链,从而缩短输出长度;其中一种策略是在该点注入EoT标记,以触发推理到回答的转换。
该研究对这一策略进行了检验,发现注入的EoT并不总会带来干净的回答阶段:模型在继续生成一段时间后才可能再次生成一个EoT,且这段位于“再次生成的EoT之前”的文本长度,与早停节省的推理token数量呈正相关,并表现出持续的推理行为。研究者将这种“类似推理的生成延续到回答阶段”的现象称为虚假CoT终止。
研究提出假设:模型对注入EoT的注意力不足是导致虚假CoT终止的原因,并据此提出一种名为“退出标记注意力偏置”(Exit-token Attention Biasing, EAB)的干预方法。
- 验证范围:四个大型推理模型、五个基准测试、两种早停方法。
- 主要结果:提高模型对注入EoT的注意力,可以降低虚假CoT终止的发生率,并缩短回答阶段长度。
- 结论:仅通过外部匹配模型的显式思考块格式来插入EoT,并不能保证实现预期的推理到回答转换,揭示了以这种方式控制大型推理模型的局限。