Kimi K3 技术报告解读:架构、训练与 Agent 基础架构的系统性创新
2026/07/28 14:37阅读量 2
Kimi K3 发布 2.8T 总参数、104B 激活参数、100 万 token 上下文,但核心价值在于通过 KDA 注意力机制、AttnRes 深度残差连接、Stable LatentMoE 专家架构以及长程 Agent 训练系统(partial rollout、AgentENV microVM),将大模型扩展中面临的计算膨胀、信息混合、负载不均和长任务阻塞等实际问题转化为可调度、可压缩、可暂停恢复的结构化方案。
事件概述
Kimi K3 发布 47 页技术报告,开放权重。最引人注目的三个数字是 2.8T 总参数、104B 激活参数和 100 万 token 上下文。但这些数字是技术改进的结果,而非真正值得关注的核心。报告聚焦于模型继续变大、上下文继续变长、Agent 长时间工作后,原有 Transformer 架构和训练系统能否支撑的问题。
核心创新点
1. 架构改进:序列、深度、宽度三维扩展
- Kimi Delta Attention (KDA):用固定大小的递归状态压缩历史 token,避免 KV Cache 随上下文线性膨胀。每个模块安排 3 层 KDA + 1 层 Gated MLA,末尾保留全局注意力。KDA 负责低成本更新长期状态,MLA 定期重新检查完整上下文。调整衰减参数下界,使计算统一为稠密矩阵乘法,更适合 GPU。
- Attention Residuals (AttnRes):替代标准残差连接,允许当前层对不同深度的表示进行加权选择。按约 12 层一个 Block 聚合,保留中间版本供后续网络调用,解决深层网络中信息混合问题。不依赖 2.8T 参数,可能被其他模型采用。
- Stable LatentMoE:将 7168 维隐藏状态压缩到 3584 维,再映射回完整维度,降低通信量。使用 SiTU-GLU 代替 SwiGLU 控制异常激活。引入 Quantile Balancing 路由均衡算法,根据分位数直接计算负载偏置,而非固定步长调整。结合 MoonEP 动态副本机制,解决极端稀疏 MoE 的设备负载不均。
2. 长程 Agent 训练 infrastructure
- Partial Rollout:不等待整批任务完成,先完成部分轨迹即更新模型,暂停未完成轨迹后恢复。通过逐 token 正则限制策略变化,容忍高度 off-policy 数据。
- AgentENV:使用 Firecracker microVM 支持 sandbox 暂停、恢复、复制和快照。训练和评估期间创建超过 5100 万个 sandbox,可在等待推理时暂停,避免持续占用资源。
- 原生多模态视觉编码器 MoonViT-V2:从零训练,不依赖预训练视觉模型,稳定性更好。多模态数据包含代码与渲染结果配对(网页、SVG、游戏等),使 Agent 可以根据实际画面修正代码,形成完整反馈闭环。
3. 长程执行能力验证
- 在 AttnRes Kernel 优化任务中,Kimi K3 在接近 24 小时内持续尝试、测试和修改,最终将相对 FLA Triton 基线的加速幅度提升至 59.7%。
- DSA Kernel 优化:经过约 24 小时持续编写代码、运行测试、调整方案,加速幅度达 55.1%,仅次于 Claude Fable 5 的 57.3%。
- MLA Kernel 优化:将性能逐步提高到 518 TFLOPS,高于 Claude Fable 5 的 493 TFLOPS。
- KDA-GPGPU Kernel 优化:超过 20 小时实验,加速幅度达 73.6%,高于 GPT-5.6 Sol 的 66.7%。
4. Scaling Efficiency 说明
官方报告称 Kimi K3 相较 K2 获得约 2.5 倍整体 scaling efficiency(达到相同验证损失所需计算量更少)。但该数字来自架构、数据、训练配方共同作用,报告未公开完整逐项消融和总训练 FLOPs。同时,K3 总参数从 1.04T 增至 2.78T,激活参数从 32.6B 增至 104.2B,层数从 61 增至 93,仍是更重、更昂贵的模型。
值得关注
- KDA、AttnRes、Stable LatentMoE 共同构成了支撑超大规模模型持续扩展的新范式,尤其是 AttnRes 可能成为独立于 K3 的通用技术。
- AgentENV microVM 和 partial rollout 解决了长链 Agent 强化学习的核心工程瓶颈,使系统能够稳定运行数小时并不断积累改进。
- 多模态视觉编码器从零训练的方法,将视觉作为 Agent 的实时反馈通道,而非独立功能。
