新跨模态检索方法WIDE:用通配符解码抑制强制幻觉,在M-BEIR上超越现有生成式检索

针对文本查询与视觉候选之间的信息不对称,WIDE通过自适应熵阈值和通配符解码动态扩展搜索空间,并在M-BEIR基准上取得领先表现。论文已被ACM MM 2026接收。

AI解读:生成式检索把表征学习和搜索统一成一个序列到序列生成任务,但在跨模态场景下,简短的文本查询和丰富的视觉候选之间存在严重的信息不对称:模型在生成标识符时,必须猜测查询里根本不存在的细节,猜错就会受到概率惩罚,导致无关候选挤进排名前列。WIDE的核心思路是承认模型"看不见"的地方,而不是强迫它硬猜。具体做法是:用自适应熵阈值离线标定每层的不确定性边界,解码时一旦检测到语义盲区,就发射通配符代替强制标识符,从而动态扩大搜索空间且不产生惩罚;最后用混合评分(离散生成置信度加连续语义相似度)对扩展后的候选池重排。这解决了生成式检索中forced hallucination的问题,同时保持索引紧凑。对做多模态搜索或检索的开发者来说,这意味着在不增加索引开销的前提下,可能获得更可靠的跨模态检索结果,尤其在文本和图像差距大的场景。不过,论文目前只报告了M-BEIR基准上的实验,尚未公开代码,泛化到其他任务和实际系统的效果仍需验证。

arXiv论文(编号2609.03554)提出一种名为WIDE(Wildcard Inference with Dynamic Expansion)的跨模态生成式检索方法,旨在解决文本查询与视觉候选之间信息不对称导致的强制幻觉(forced hallucination)问题。论文已被第34届ACM国际多媒体会议(ACM MM 2026)接收。

WIDE在M-BEIR基准上的实验表明,其性能优于现有最先进的生成式检索方法,同时保持紧凑的索引结构。

方法原理

论文指出,生成式检索将表征学习和搜索统一为单个序列到序列生成任务,但扩展到跨模态检索时,简洁文本查询与密集视觉候选之间的结构不匹配,会使自回归解码器在使用标准trie约束束搜索生成标识符时出现强迫性幻觉。具体而言,模型因无法猜测查询中不存在的细粒度细节而受到严重惩罚,导致无关候选占据排名前列。

WIDE包含三个组件:自适应熵阈值(Adaptive Entropy Thresholding, AET)用于离线校准各层的不确定性边界;非对称感知通配符解码(Asymmetry-aware Wildcard Decoding, AWD)在解码阶段检测语义盲区,发射通配符而非强制确定标识符,从而动态扩展搜索空间且不产生对数概率惩罚;盲点重排(Blind-Spot Re-ranking, BSR)通过结合离散生成置信度与连续语义相似度的混合评分机制,评估扩展后的候选池。

论文信息

论文作者为Teng Guo、Xin Wang、Jiayou Xu、Keying Zhou、Jifeng Shen和Haoxin Ruan,于2026年9月3日提交至arXiv(v1),共10页、5幅图,涉及计算机视觉与模式识别(cs.CV)及人工智能(cs.AI)领域。

稿件内容基于arXiv上传的摘要,未验证完整论文的细节。

信息来源