AI大模型重燃“参数军备竞赛”:DeepSeek瞄准8万亿,MoE架构与Agent需求成关键推手
随着DeepSeek宣布计划训练8万亿参数新模型,Kimi、字节跳动及阿里等头部厂商纷纷将目标参数规模提升至5-10万亿区间,标志着大模型行业重新进入以总参数量为标志的规模竞赛。这一转变得益于混合专家(MoE)架构的应用,使得模型总容量与单次计算激活量分离,大幅降低了扩展规模的边际成本。同时,Agent时代对长任务处理中能力全面性的严苛要求,使得更大的参数容量成为承载广泛知识分布和避免“木桶效应”的核心基础设施。
事件概述
近期,全球主要人工智能实验室在基础模型参数规模上展开新一轮激烈竞争。据The Information报道,DeepSeek正在训练约2万亿参数的新模型,并计划在后续迭代中将参数规模推至8万亿,相当于其此前发布的V4-Pro模型规模的5倍。与此同时,月之暗面(Kimi K3)、字节跳动、阿里巴巴以及Anthropic等机构也相继披露或传闻其下一代模型参数规模将达到5万亿至10万亿级别。这标志着在大模型经历了一段时间的效率优化和小模型探索后,前沿技术路线再次回归对超大参数规模的追求。
核心信息
1. 头部厂商参数规模突破
- DeepSeek:在完成约150亿美元的外部融资筹备科创板IPO后,算力条件显著改善。从此前强调极致效率转向大胆扩张规模,下一步目标是8万亿参数。
- 月之暗面(Kimi):已发布K3模型,拥有2.8万亿总参数和1040亿激活参数,性能指标已与GPT-5.6 Sol、Claude Fable 5等顶尖闭源模型持平。
- 字节跳动:内部讨论预训练最高可能达10万亿参数的新模型,由Seed Foundation负责人项亮主导,意图通过一次性大幅超越同行来确立优势。
- 阿里巴巴:CEO吴泳铭公开表示,下一代模型计划实现5万亿到10万亿参数。
- Anthropic:虽未公开具体数据,但业内估计其旗舰模型Mythos 5参数规模约为8万亿。
2. MoE架构改变规模竞赛逻辑
当前超大参数模型的竞争并非简单重复过去的Dense(密集)架构模式,而是基于Mixture of Experts(混合专家,MoE)架构。
- 容量与计算解耦:在MoE架构下,模型的总参数量(存储知识的空间)与每次Token生成的激活参数量(实际计算量)分离。例如,DeepSeek V4-Pro拥有1.6万亿总参数,但每个Token仅激活约3%(490亿参数);Kimi K3拥有2.8万亿总参数,但每个Token仅激活约3.7%(1040亿参数)。
- 扩展性提升:这种架构允许模型在不显著增加单次推理成本的前提下,无限扩大总参数容量,从而容纳更复杂的知识分布和能力模式。
3. Agent时代放大参数价值
应用场景从单一的Chatbot问答转向复杂的Agent(智能体)长任务执行,推动了对模型“能力覆盖面”的需求。
- 木桶效应显现:Agent任务通常涉及搜索、编程、工具调用、错误修正等多个环节,链条长达数十步甚至数百步。任何单一能力的短板都可能导致整个任务链中断。
- 全面性需求:相比过去追求单项Benchmark的峰值,Agent时代要求模型具备更广泛的知识储备和更稳定的多领域处理能力。更大的总参数容量为这种全面性提供了必要的底层支撑。
值得关注
尽管DeepSeek等公司曾以“低成本高效率”著称,但随着资本注入和算力基础设施的完善,行业逻辑已从“如何在有限资源下做优”转向“如何利用充足资源做大”。效率的提升(如MoE架构、蒸馏技术等)并未终结Scaling Law(缩放定律),反而为更大规模的参数扩展腾出了空间。未来,5T+参数级别的模型将成为冲击能力上限的主要路径,竞争焦点将从单纯的参数数字转向基于MoE架构下的综合效能与Agent适配能力。
