新论文提出Lngram v2:为Transformer加入可扩展的离散潜在n-gram记忆机制
Lngram v2通过解耦路由数与记忆维度并引入上下文感知的分组查询注意力读出,将记忆容量扩展到300亿参数视觉语言模型,同时减少总参数与激活参数。
arXiv上发布的一篇新论文(编号2609.03426)提出Lngram v2,一种为Transformer设计的潜在条件记忆机制,宣称通过离散的潜在n-gram寻址实现与分词器无关的条件记忆,并在300亿参数的视觉语言模型上成功扩展。
论文作者为Yunao Zheng、Bin Wen和Xiaojie Wang,提交于2026年9月3日,目前仅为预印本,尚未经过完整同行评审。
Lngram v2如何解决Lngram v1的局限
作者指出,Transformer缺乏原生查找机制,需要重复密集计算来识别和复用局部静态模式。Lngram v1引入了与分词器无关的条件记忆,通过离散潜在n-gram寻址实现,但其记忆容量与主干宽度耦合,导致参数和激活成本高,限制了可扩展性。
Lngram v2的主要改进是解耦路由数、记忆维度和主干宽度,使记忆容量可以独立扩展。同时引入上下文感知的分组查询注意力读出(context-aware grouped-query attention readout)来提升读取的选择性。
为了在保持硬离散寻址的同时改善可训练性,作者引入了零值Sink(zero-value Sink)和反事实代理梯度(counterfactual surrogate gradients)机制。
实验结果与宣称效果
论文报告称,实验覆盖不同规模的视觉语言模型(VLM),显示一致的改进,包括成功扩展到300亿参数模型。
与Lngram v1相比,Lngram v2大幅减少了总记忆参数和激活记忆参数,同时保持或提升了语言建模性能。具体减少比例在论文中未给出。
进一步分析表明,Lngram v2的离散ID保留了连续隐状态的大量语义结构,仅凭ID即可恢复语义,且跨数据集的ID与语义关联保持稳定。