新研究:从隐藏状态直接注入推理token,GSM8K准确率超过原思维链

arXiv预印本通过激活修补发现,把思维链生成中的token级隐藏状态转移到直接回答运行中,能恢复正确答案,且修补后输出更短、准确率更高。论文将发表于Findings of EMNLP 2026。

AI解读:这项研究想回答一个基础问题:语言模型展示的思维链(CoT)到底是计算必需的,还是只是事后解释?作者用激活修补方法,把一次CoT生成中某些token的隐藏状态,直接替换到同一问题的直接回答运行里(即不生成任何推理过程),结果准确率不仅超过直接提问,还超过原本的完整思维链输出。这说明思维链里的关键token编码了足够恢复正确答案的信息,即便原来的推理链是错的。对普通使用者来说,这个发现不要求你改任何提示词,也不需要新工具,但它提示:如果你遇到模型在长推理后仍答错的情况,问题可能不在推理步骤本身,而在关键推理位置的隐藏状态;对开发者而言,识别这些token集中出现的中晚期层位置,将来可能用于早停或局部修正推理,减少计算量。限制也很明确:实验只在GSM8K算术数据集上,跨任务泛化性还没验证。

一项将对思维链(Chain-of-Thought, CoT)进行机制性因果分析的arXiv预印本研究显示,把思维链生成过程中的token级隐藏状态转移到直接回答运行(不生成推理过程),其最终答案准确率在多个模型上均显著高于直接回答提示(direct-answer prompting)和原始思维链输出。作者据此认为,单独的思维链token可能编码足够信息恢复正确答案,即便原始推理是错误的。

方法:激活修补,将隐藏状态从思维链转移到直接回答

该研究在GSM8K(小学数学应用题基准)上进行,作者通过激活修补(activation patching)实现因果分析:将一次思维链输出中token级的隐藏状态替换到同一个问题的直接回答(direct-answer)运行里,再测量对最终答案准确率的影响。

关键发现:任务相关信息集中且可转移的表现形式多样

论文的发现包括以下几个方面:任务相关信息在正确思维链中比错误思维链中更常见,并且分布不均匀,集中在中后期层(mid-to-late layers),且出现在推理轨迹的更早阶段。

在单词类型上,语言词(如动词和实体)的注入携带任务求解信息,能将生成引导向正确推理;而数学token编码的内容则接近答案,很少能成功引导出正确回答。

经修补的输出往往更短,却超过完整思维链的准确率——作者认为这表明完整的推理链并不总是必要的。

信息来源