arXiv新研究:从广义统计熵导出两类注意力算子,替代Softmax的代数衰减方案
论文基于Kaniadakis熵和Abe熵构建完整注意力框架,权重与低分敏感度呈代数衰减而非指数衰减,还给出判断熵变更是否改变注意力分布的切线梯度检验。
AI解读:Transformer中的Softmax注意力有一个已知瓶颈:它对所有分值做指数归一化,低分token的权重被压得指数级小,几乎不参与学习。这篇arXiv论文想做的是,从更广义的统计熵出发,推导出两类新的注意力算子,让权重衰减变慢——Kaniadakis熵给出的算子,权重和低分敏感度都按代数规律衰减,这意味着模型可以在数学形式上避免Softmax那种"赢家通吃"的极端分布。对做注意力机制研究的工程师来说,价值在于论文给了一个可操作的判断工具:切线梯度检验,用来判断换一种熵是否真的改变了注意力形状,还是只是整体缩放——这能帮研究者少走弯路。不过要注意,文章明确说是理论框架,删掉了之前的数值实验,也没有报告在真实Transformer上的效果提升数据;所以它解决的是"注意力算子能否有更丰富的数学形式"的问题,而不是"哪种算子在实际任务上更好"。读者不必急着改代码,但如果方向被后续实验验证,Softmax一家独大的局面可能被打破。
arXiv 9月3日更新的论文(编号2602.08216v3)从广义统计熵推导出两类注意力算子:Kaniadakis熵给出精确的全支撑归一化,其权重和低分敏感度呈代数衰减,而非Softmax的指数衰减或entmax的精确截断;经典Abe熵则给出隐式互反对称算子。
论文作者Gunn Kim在10页正文和1幅图中建立了从熵到注意力的完整框架,替代了此前版本的数值研究。他强调,区分"分布形状等价"与"固定参数算子等价",可以把新的归一化形状与自适应重缩放分开,并按支撑集、尾部行为和实现复杂度对算子分类。