5350亿参数MoE大模型“直播”训练全程:代码、数据、Loss全公开,吴恩达力挺
2026/08/25 13:51阅读量 3
斯坦福Percy Liang团队启动Marin 535B-A23B训练,总参数5350亿、每Token激活230亿,计划处理18.75万亿Token,耗时约3个月。项目全程公开代码、数据、训练曲线和失败记录,被吴恩达称为捍卫AI开放性的“珍贵示范”。目前训练仍处早期,最终能否成为前沿模型尚待观察。
事件概述
斯坦福大学计算机科学副教授、基础模型研究中心(CRFM)主任Percy Liang发起的开放基础模型项目Marin,已启动Marin 535B-A23B训练。该模型为MoE架构,总参数约5350亿,每处理一个Token激活约230亿参数。按计划将处理18.75万亿Token,其中约80%用于预训练、20%用于中期训练,运行在11套NVIDIA GB200 NVL72系统上,预计持续约3个月,总计算量约2.7×10²⁴ FLOPs,之后进入后训练阶段。
核心信息
- 透明程度激进:Marin并非只开放最终权重,而是在训练过程中通过GitHub Issue、Pull Request和W&B实时公开代码、数据配方、配置决策以及成功/失败实验记录,试图建立类似开源软件的协作机制,让外部研究者参与Review。
- 模型设计:每层保留2个共享专家,同时激活8个路由专家,并采用半宽结构。训练上下文先设为4K,以降低专家负载不均和Token Dropping风险。团队此前测试显示,上下文从4K扩展到65K时,Token Dropping比例曾从约7%升至约40%;在4K上下文和新型pooled/wave专家并行方案下,可降至约3%。
- 工程挑战:由于未找到JAX/XLA GPU环境中性能足够的现成专家并行方案,团队自行实现了Expert Parallelism。此前Marin 8B和32B模型主要运行在Google TPU上,此次转向NVIDIA GB200 NVL72,需要重新处理GPU集群上的专家并行与通信效率问题。
- 训练稳定性预检:正式训练前,团队先训练了1.6B至27.7B参数的四级“缩放梯”模型,约占总计算量的1%。通过缩放实验发现梯度范数在长训练周期中一度增长到4以上,最终加入logit z-loss限制输出分布数值幅度,降低Softmax和路由训练的数值不稳定风险。如果主训练曲线明显偏离预测值,团队会提前介入。
- 开放谱系并非“全球首个”:BLOOM、Pythia、OLMo等此前已公开训练日志、数据和中间检查点。Marin的不同之处在于把开放从“模型发布阶段”扩展为实验室的默认工作方式,训练尚未完成即公开所有过程记录。
值得关注
现在谈“前沿性能”为时尚早。MoE的535B不能简单等同于535B稠密模型,预训练损失也不直接等于代码、数学、工具调用等最终能力。项目仍处于训练早期,公开材料中训练Token口径也仍在对齐(GitHub写作“18T tokens”,公告为18.75T)。无论最终成败,训练过程中涉及的专家路由、Token Dropping变化、梯度异常、长上下文扩展以及JAX在GB200上的专家并行实现,都可能成为大规模MoE训练的重要公开样本。
