蚂蚁发布全球首个Agentic扩散模型LLaDA2.2:并行生成+自我纠错,128K上下文追平自回归

2026/07/28 12:18阅读量 3

蚂蚁集团inclusionAI团队开源LLaDA2.2,这是全球首个千亿参数MoE扩散语言模型,原生支持128K上下文,专为智能体任务设计。它通过Levenshtein编辑、L-EBPO强化学习和BlockRouting机制,实现了边生成边修正的能力。在七大Agent基准测试中,LLaDA2.2-flash平均得分53.83,逼近顶尖自回归模型Ling-2.6-flash的55.74分,部分交互任务反超,且吞吐量达到后者的1.64倍,标志着扩散模型正式进入Agent赛道。

事件概述

蚂蚁集团旗下inclusionAI团队开源LLaDA2.2,这是一款千亿参数的MoE扩散语言模型,原生支持128K上下文,也是全球首个大规模Agentic扩散模型。该模型打破了自回归模型在Agent领域的垄断,通过引入Levenshtein编辑范式、基于环境反馈的强化学习以及长上下文工程架构,实现了并行生成与动态修正的结合。

核心信息

技术突破

  • Levenshtein编辑范式:在扩散模型的去噪过程中支持四种原子操作——KEEP(保留)、SUBSTITUTE(替换)、DELETE(删除)、INSERT(插入)。模型可以对自身的生成结果进行增删改,避免传统扩散模型“块内结构刚性”的缺陷。在SWE-bench Verified上,仅开启Levenshtein编辑即可获得8.6个百分点的绝对提升(35.8 → 44.4)。
  • L-EBPO(Levenshtein Editing EBPO):将多轮交互中的编辑决策建模为强化学习问题,使模型能根据环境反馈自动判断何时删除、何时插入,实现“边行动边纠错”。
  • BlockRouting:在MoE架构中先进行block级专家筛选,再执行token级路由,固定专家池大小,大幅降低HBM流量和通信开销,确保128K长上下文下的推理效率。

性能表现

  • 基准对比:在七大Agent基准上,LLaDA 2.2-flash与顶尖自回归模型Ling-2.6-flash正面竞技,平均分为53.83 vs 55.74,差距缩小到2分以内。其中在τ²-Bench、PinchBench、MCP-Atlas三项交互式任务上实现反超。
  • 效率优势:在11类工作负载上,LLaDA2.2-flash的BF16平均吞吐量是Ling-2.6-flash的1.64倍;进一步量化至FP8后,平均吞吐量还可额外提升18.6%

演进路线

LLaDA系列半年内迭代三代:

  • LLaDA 2.0:验证扩散模型与MoE结合的规模化可行性。
  • LLaDA 2.1:引入Token-to-Token编辑机制,实现“边写边改”。
  • LLaDA 2.2:整合Levenshtein编辑、强化学习与长上下文架构,正式迈入Agentic任务。

值得关注

LLaDA2.2并未彻底超越自回归模型,但其核心价值在于证明自回归并非Agent大脑的唯一选择。扩散模型在速度、成本上具备天然优势,更适合对延迟敏感的物理世界部署场景。文章预测,未来的Agent系统可能采用“双轨并行”架构:强因果流程由自回归负责,快速探索与并行生成由扩散承担,两种机制按任务阶段动态切换。

技术报告与开源代码已发布:

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。