TEVI框架:用稀疏自编码器按文本条件编辑CLIP图像嵌入,提升图文检索对齐
来自EMNLP 2026的论文提出TEVI,利用稀疏自编码器解耦图像嵌入,并训练掩码模块根据字幕选择性重建,以改善CLIP等视觉语言模型的图像与文本嵌入对齐问题。
来自马克斯·普朗克信息学研究所等机构的研究者提出TEVI框架(arXiv:2606.07451),用于改善CLIP等视觉语言模型中图像与文本嵌入的对齐问题。该论文被EMNLP 2026 Findings接收,共26页、19张图、20张表。
TEVI针对的已知问题是:图像嵌入包含的信息比其字幕描述的多,这种信息不平衡导致图像与文本嵌入往往无法精确对齐,进而影响下游任务表现。研究者提出的方案是使用稀疏自编码器(SAE)将图像嵌入解耦成可解释的组成部分,再训练一个掩码模块,根据给定字幕有选择性地重建嵌入。
方法:字幕作为保留信号
TEVI把字幕当作决定图像嵌入中应该保留哪些信息的控制信号。流程分为两步:首先用稀疏自编码器将CLIP图像嵌入分解为稀疏的组成部分;然后训练一个掩码模块,输入字幕文本,输出一个掩码,决定保留哪些成分、丢弃哪些成分,从而重建出与字幕对齐的嵌入。
论文作者包括Sweta Mahajan、Sukrut Rao、Jiahao Xie、Alexander Koller和Bernt Schiele。代码已在GitHub上公开(https://github.com/neuroexplicit-saar/TEVI)。
- 在受控实验中使用合成字幕验证,TEVI能有效保留字幕描述的属性,同时丢弃无关属性。
- 在自然图像训练的CLIP模型上,TEVI能学到有意义的掩码,并支持基于条件的检索。
性能:在多个检索基准上提升
论文报告,TEVI在粗粒度和细粒度的多个基准上均取得了改进的检索性能。论文没有提供单独的基准名称或具体提升数字。
论文的评测以图像-文本检索为核心,没有报告在分类、生成等下游任务上的效果,也没有提供对新训练图像类别或新文本概念的泛化测试结果。
- 这项工作的假设前提是:图像比其字幕承载更多信息,由此造成的嵌入不平衡是CLIP图像-文本对齐不佳的原因之一。
- TEVI针对的字幕可能是不完整的或泛化描述的场景,尚未验证其在长字幕、多物体图像或复杂场景下的表现。