GPT-6带火循环Transformer后,阿里团队用两篇论文回应计算冗余难题
阿里与合作高校团队发表MeSH和SpiralFormer两篇论文,分别解决循环Transformer内部信息管理和计算粒度问题,以应对Astra引发的循环深度技术热议。
AI解读:GPT-6 Astra采用的循环深度技术,让同一组Transformer层反复运行,在参数不增加的情况下加深计算,但学界此前发现,循环次数增加后,后续计算带来的增量越来越小,出现所谓“计算冗余”。阿里团队在Astra发布前就已针对这一短板布局,其MeSH和SpiralFormer两篇论文分别从信息管理和计算粒度入手,缓解循环空转问题。对研究者和模型开发者而言,这意味着循环架构不再是“多算几轮就变强”的空想,而是有了可操作的设计思路。但论文目前仅在小规模(1.4B参数)实验验证,距离大规模商用仍需更多测试。
GPT-6 Astra发布后,循环深度技术成为焦点。该技术让同一组Transformer层反复运行,在不增加同等规模参数的情况下加深计算。阿里与合作高校团队早于11个月前发表两篇论文,MeSH和SpiralFormer,分别指向循环Transformer的计算冗余问题,并已被ICLR 2026和EMNLP 2026接收。
MeSH:动态管理循环间的信息,减少空转
阿里团队指出,循环Transformer存在“计算冗余”:靠堆参数的传统Scaling方式不同,循环架构用计算深度换参数规模。然而多循环几圈并不一定更强。在同等算力下,省了参数的循环模型常打不过普通Transformer,原因是循环后续轮次带来的增量极小。
- MeSH论文通过在循环之间加入Memory Buffer和路由器,动态分配信息,减少重复劳动。实验显示,在Pythia-1.4B级别,循环结构通过权重共享减少约33%的非嵌入参数,加入MeSH后,零样本下游平均准确率从49.50%提高到50.56%,领先1.06个百分点。路由器新增参数仅约非嵌入参数的0.005%,额外计算开销约0.014%。
SpiralFormer:动态调整序列长度,从全局到局部
SpiralFormer论文将每轮循环的序列长度变为可调,受Coconut等隐式思考工作启发,压缩序列后计算。实验显示,在Pythia-1.4B级别,SpiralFormer-L与普通Transformer参数量基本相同,计算量从14.08T FLOPs降至13.13T,5-shot下游平均准确率从51.93%提高到54.37%。
- SpiralFormer采用从粗到细的序列缩放,例如从原序列1/8长度开始,逐步扩展到1/4、1/2,最后到完整序列。为保证自回归生成不泄露未来信息,写回结果进行了右移。注意力probing显示,早期低分辨率循环关注范围更广,后期高分辨率循环更关注局部token。