新研究质疑多模态大模型的“潜在空间想象”:隐层几乎不响应输入,作者提出文本显式想象框架CapImagine

清华大学等团队用因果中介分析拆解潜在空间视觉推理,发现隐层token与输入和答案均存在脱节;其提出的文本式显式想象方法CapImagine在视觉任务上表现更好,论文已被ICML 2026接收。

AI解读:这条新闻解释了为什么“让模型在隐层空间默默思考”不算可靠的视觉推理路径。研究团队用因果中介分析对多模态大模型做手术:大幅扰动输入图片,隐层token几乎不变;反过来改动隐层token,最终答案也不受影响。两条因果链都是断的,说明这些隐藏状态并没有真正承接视觉信息,也没在决定答案上发力——它们更像是一堆彼此相似的占位符。于是作者换了个方向:不让模型在“黑盒”里冥想,而是用文字明确写出图像里有什么,再基于文字推理。这个叫CapImagine的方法在视觉推理基准上明显赢过复杂的潜在空间方案,论文已被ICML 2026录用。对研究者和工程人员来说,这意味着在评估或部署“隐式推理”机制时要多留一个心眼:先验证那些中间变量是否真的传导了信息,再决定要不要为它增加计算开销;CapImagine也提示,低成本的显式描述有时反而比精巧的隐式设计更有用。对普通用户,目前没有需要立即采取的行动,只是技术路线的一次方向性修正。

一篇被ICML 2026接收为Poster的论文提出,多模态大语言模型(MLLM)中“在潜在空间进行视觉推理”的做法可能并不像其宣称的那样有效。来自清华大学等机构的研究者用因果中介分析(Causal Mediation Analysis)拆解这一过程,发现输入、隐层token与最终答案之间存在两处关键脱节,并据此提出一个简单的文本式替代方法CapImagine,实验显示其在视觉基准上显著优于复杂的潜在空间基线。

论文作者为You Li、Chi Chen、Yanghao Li、Fanhu Zeng、Kaiyu Huang、Jinan Xu和Maosong Sun,论文以预印本形式发布在arXiv(编号arXiv:2602.22766,v3为最新版本),DOI为10.48550/arXiv.2602.22766。

因果分析发现两处“脱节”

研究将潜在视觉推理建模为一条因果链:输入作为处理变量(treatment),隐层token作为中介变量(mediator),最终答案作为结果变量(outcome)。分析揭示出两个关键问题:

其一,Input-Latent Disconnect:对输入施加大幅扰动后,隐层token的变化却微乎其微,表明隐层token并未有效关注输入序列;其二,Latent-Answer Disconnect:扰动隐层token对最终答案的影响很小,说明隐层token对结果只有有限的因果效应。

  • 进一步的probe分析显示,隐层token携带的视觉信息有限,且彼此相似度高。
  • 作者据此对潜在空间推理的必要性提出质疑。

CapImagine:用文字显式“想象”

作为替代,研究提出CapImagine,一个通过教会模型用文本形式进行显式想象的简单框架。

在面向视觉的基准测试中,CapImagine的表现显著优于基于复杂潜在空间的基线方法,研究认为这凸显了通过显式想象进行视觉推理的更大潜力。

论文的投稿记录显示,该预印本历经三次修订:v1于2026年2月26日提交,v2于2026年6月7日更新,v3于2026年9月3日更新,最新版本标注为ICML 2026 Poster。

信息来源