阿里两篇顶会论文揭示循环Transformer核心痛点:解决计算冗余与分工缺失
受GPT-6(Astra)采用循环深度技术影响,循环Transformer架构引发关注。阿里及合作高校团队早在11个月前通过MeSH和SpiralFormer两篇论文,深入解决了该架构中的“计算冗余”难题。MeSH通过动态记忆缓冲区分流信息,解决轮次间同质化问题;SpiralFormer引入多分辨率序列压缩,实现从全局到局部的梯度计算。这两项研究为构建高效、低参数的大模型提供了新的技术路径。
事件概述
近期,OpenAI发布的Astra模型因采用“循环深度”(Recurrent Depth)技术而引发行业热议。该技术允许同一组Transformer层在隐藏状态中反复运行,旨在不增加参数规模的前提下提升模型计算深度。然而,学术界指出循环架构面临严重的“计算冗余”问题:随着循环次数增加,后续轮次的信息增量急剧下降,导致效率低下。
针对这一瓶颈,阿里及合作高校研究团队在ICLR 2026和EMNLP 2026上分别发表了MeSH和SpiralFormer两篇论文,从信息管理和计算粒度两个维度提出了系统性解决方案。
核心问题分析:循环为何“空转”?
研究团队通过对循环Transformer内部机制的剖析,发现了导致性能提升受限的三个关键现象:
- 更新幅度递减:首个核心循环(Core Loop)承担了绝大部分的状态更新,后续循环的变化幅度迅速缩小。
- 表示高度相似:相邻轮次的隐藏状态相似度极高,表明网络在不同阶段缺乏明确分工。
- 信息空间坍缩:奇异值谱分析显示,经过多次循环后,模型表示逐渐挤入低维空间,表达能力趋于单一。
诊断结果显示,传统循环模型存在“计算无分化”和“信息过载”两大缺陷。共享网络难以形成阶段性分工,且原始输入、历史记忆与当前计算全部挤压在同一隐藏状态中,导致处理效率低下。
解决方案一:MeSH —— 动态信息管理
MeSH(已被ICLR 2026接收)旨在解决循环内部的信息流转问题。
- 机制创新:引入Memory Buffer(记忆缓冲池),将历史信息从主隐藏状态中分流出去。配合Write Router(写入路由器)和Read Router(读取路由器),模型可动态决定每轮新信息的存储权重及下一轮历史信息的读取组合。
- 效果验证:在Pythia-1.4B模型实验中,加入MeSH后,非嵌入参数减少约33%,零样本下游平均准确率从49.50%提升至50.56%。新增的路由器参数仅占普通Transformer非嵌入参数的0.005%,额外计算开销约为0.014%,实现了极高的性价比。
- 改进成效:该机制有效缓解了隐藏状态的单一化趋势,使不同循环轮次能够形成更清晰的功能分工。
解决方案二:SpiralFormer —— 多尺度计算粒度
SpiralFormer(已被EMNLP 2026接收)进一步解决了“每一轮都处理完整序列”带来的算力浪费问题。
- 机制创新:借鉴隐式思考(Latent Reasoning)思路,将序列长度(seq_len)作为可调变量。模型按照“从粗到细”的顺序进行循环:先压缩相邻Token生成紧凑表示(如原长度的1/8),在潜空间中完成初步计算后,再逐步扩展至1/4、1/2直至完整序列。
- 注意力模式演变:Probing实验显示,早期低分辨率循环中注意力分布广泛,侧重捕捉全局模式(Global Pattern);后期高分辨率循环中注意力集中,侧重局部关系(Local Pattern)。这种分工并非自动产生,而是由多分辨率设计驱动。
- 效果验证:在相同参数量下,SpiralFormer-L的计算量从14.08T FLOPs降至13.13T FLOPs,5-shot下游平均准确率从51.93%提升至54.37%。
- Scaling新维度:研究发现循环比例与性能呈U形曲线关系,最佳表现出现在30%-40%的循环层占比区间。这提示未来可通过调整每轮的序列压缩尺度来优化模型性能。
结论与展望
MeSH和SpiralFormer分别从“拿什么算”(信息分配)和“以什么粒度算”(序列尺度)两个层面补全了循环Transformer的技术短板。尽管循环架构节省的是参数而非直接算力,但通过消除冗余和提升分工效率,为下一代高效大模型提供了一条可行的Scaling路径。随着更多研究深入,循环Transformer有望成为平衡模型能力与资源消耗的重要候选方案。
