新研究发现语言模型在不确定时回退到训练语料的词汇先验,可被几何方法识别

arXiv论文声称,在Llama、Qwen、Gemma、Pythia四个模型家族的unembedding矩阵中均发现一个编码训练语料unigram分布的方向,可作为模型不确定时的贝叶斯先验。

AI解读:这篇论文试图回答一个基础问题:语言模型在缺乏上下文线索时靠什么预测下一个词?研究者从四个流行模型家族(Llama、Qwen、Gemma、Pythia,规模从 4 亿到 4050 亿参数)的unembedding矩阵中发现一个特定方向,它近似编码了训练语料中每个单词的出现频率。当上下文提供的信息越少,模型的预测状态就越靠近这个方向;研究者称之为“无知方向”,并证明它相当于一个贝叶斯先验,模型在不确定时自动回退到它。这个发现的意义在于提供了一个可量化的诊断工具:通过投影计算出一个“先验加载因子 λ”,能直接测量模型在某一输入下有多依赖通用统计规律、有多依赖具体语境。对研究者和开发者来说,这比过去黑盒式的“模型不确定度”更结构化,可以用来解释幻觉的根源——当输入信息不足时,模型只是在沿用语料库的统计惯性——并为调控模型行为提供了一个可操作的维度,因为作者展示了在预测状态上调整 λ 能让输出更贴或更离先验。不过需要指出,这只是一个预印本论文的摘要结论,尚未经过同行评审,而且所有观察都集中在词级预测上,是否对更长的推理任务有效仍不清楚。普通用户不需要为此做任何事;真正受影响的可能是在做模型可解释性或安全控制的工程团队,他们可以尝试把 λ 这类指标接入现有评估中。

一项预印本研究提出,语言模型在预测时缺少上下文线索时,会回退到由训练语料词频构成的“无知方向”(direction of ignorance),该方向编码于模型的unembedding矩阵中,相当于一个贝叶斯先验。研究者表示,在Llama、Qwen、Gemma和Pythia四个模型家族(参数规模从 0.4B到 405B)中均观察到这一结构,相关论文于 2026 年 9 月 2 日提交至arXiv。

几何解释与校准因子

论文将模型最终预测状态投影到“无知方向”上,得到一个逐词的先验负载因子 λ。实证表明,该值随上下文信息量的增加而稳定下降,形式上,这一投影把预测状态分解为两个正交向量,分别对应温度化贝叶斯更新中的两项:unigram先验的 λ 次幂与上下文驱动的似然。这种几何解释允许对 λ 进行校准,使其在不同模型大小和家族之间具有可比性,论文称在上下文信息充分的情况下,更大的模型通常表现出更低的先验依赖。

因果验证

作者进一步展示“无知方向”具有因果活性:在最终预测状态上人为升高或降低 λ,会以KL散度衡量的方式,把预测结果导向或偏离unigram先验。依据仅为论文摘要,UNFINISHED,需注意论文尚未经过同行评审。

信息来源