蚂蚁百灵发布Ling-3.0-Flash:124B参数原生混合推理模型,激活仅5.1B
2026/07/27 09:57阅读量 2
蚂蚁百灵于7月24日发布新一代原生混合推理模型Ling-3.0-Flash,总参数量124B,单次激活5.1B。该模型采用5:1混合注意力架构,通过KDA线性注意力层与MLA层交替堆叠,并将专家激活比例压缩至1/64,实现高智效比。模型已上线OpenRouter,限时免费一周后开源。
事件概述
蚂蚁百灵于2026年7月24日正式发布新一代原生混合推理模型Ling-3.0-Flash。该模型总参数量124B,但单次计算仅激活5.1B参数,在显著缩减体量和算力开销的同时,基础推理、指令遵循及长文本处理等核心指标对标甚至超过参数规模2-3倍的行业领先模型。
核心技术与架构
- 混合注意力架构:从预训练阶段即采用5:1比例交替堆叠KDA线性注意力层与MLA层,在长上下文效率与模型能力间取得平衡。
- KDA(Kimi Delta Attention):将上一代Lightning Attention升级,在Delta Rule的状态更新中引入细粒度对角门控,提升长文档和代码库的关键信息记忆能力。
- 专家激活压缩:每个Token的专家激活比例由前代的1/32进一步压缩至1/64,带来更高“效率杠杆”。
Agent场景深度优化
- 扩展超过10000个真实交互训练环境,强化自我纠错与长程规划机制。
- 在代码编写、复杂任务拆解、多源信息深度调研等场景中展现更强的自主闭环交付能力,解决传统模型在大任务中易“跑偏”或断档的问题。
工程与协作架构
- 集群级分级缓存:避免长对话和多轮交互中的重复计算,将长输入下首字响应延迟降低60%-80%以上。
- 多智能体协同架构:允许不同Agent分工协作、相互校验,减少单一模型误判风险,支撑高频线上服务与真实业务落地。
开放与开源计划
Ling-3.0-Flash已上线OpenRouter平台,限时免费一周,后续将正式开源。
