Kimi K3 开放权重与技术报告:架构细节公开,但数据来源疑云未解

2026/07/29 13:42阅读量 2

月之暗面于7月27日开放Kimi K3模型权重及技术报告,并开源三项基础设施。报告详细解释了2.8万亿参数混合专家模型、混合注意力结构和多教师在线蒸馏等能力提升路径,但未完全披露预训练数据来源,未能直接回应此前关于蒸馏Claude的指控。

事件概述

月之暗面于7月27日发布Kimi K3模型权重和技术报告,同时开源三项关键基础设施:面向超大规模MoE通信的MoonEP、面向线性注意力的FlashKDA,以及长周期智能体强化学习环境AgentEnv。K3总参数2.8万亿,激活参数约1042亿,为目前规模最大的开放权重模型之一。

核心信息

  • 技术架构:K3采用混合专家架构,含896个路由专家,每Token激活16个专家加2个共享专家。通过3:1比例混合Kimi Delta Attention与Gated MLA,原生上下文窗口扩展至约100万Token。引入Attention Residuals解决深层信息稀释问题,Stable LatentMoE实现约2.5倍扩展效率提升。
  • 后训练流程:先监督微调建立冷启动模型,再在通用、智能体、编程三个方向各训练三档推理强度(low/high/max),形成九个专业教师策略,最终通过多教师在线策略蒸馏(MOPD)合并为统一模型。报告显示MOPD的教师为K3内部专业策略,未提及外部模型。
  • 争议背景:Anthropic指控月之暗面通过大量虚假账户获取Claude输出用于训练,涉及超340万次交互;美国官员称月之暗面蒸馏Fable模型用于K3。中国商务部回应称缺乏实际证据,强调模型蒸馏为行业通用技术。
  • 外部验证:昇腾已宣布0day适配K3,vLLM、SGLang等框架提供运行支持,但社区尚未独立复现其宣称的效率与性能。

值得关注

技术报告提供了K3能力提升的完整架构和算法解释,但未公开预训练语料、监督微调数据及奖励模型数据来源,因此无法直接反驳蒸馏外部模型的指控。月之暗面证明了自身的技术路径,但数据源问题仍需进一步澄清。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。