Sand.ai开源MAGI-2-preview:114B参数、6B激活,称全球首个千亿MoE视频生成模型

2026/08/05 15:05阅读量 2

Sand.ai发布并开源MAGI-2-preview,总参数114B、单次激活约6B,称其为全球首个千亿参数MoE视频生成模型。该模型在AA视频生成榜单排名第六,按8卡H100行情,生成10秒1080P视频成本约0.5元。其核心用单流架构、Multi-Head LatentMoE和自研系统,把MoE扩展到视频生成赛道。

事件概述

Sand.ai 开源了视频生成模型 MAGI-2-preview。模型总参数 114B,单次前向激活约 6B,Sand.ai 称这是全球首个千亿参数 MoE 视频生成模型。在 AA 视频生成榜单上,MAGI-2-preview 排名第六;按 8 卡 H100 的行情,生成一段 10 秒 1080P 视频的成本约为 0.5 元,约为行业主流模型的十分之一。

核心信息

  • MoE 路径:视频生成面对长视频、多模态和长序列输入,直接照搬 LLM 的稠密 Scaling 路线会带来难以承受的训推成本。MoE 将模型容量与单次计算解耦,可以保留千亿级总参数,同时控制每次推理的激活成本。
  • 架构:MAGI-2-preview 沿用单流架构,文本、视频、音频进入同一个 Transformer,每一层自注意力直接交换信息;统一主干也更适合 MoE 扩展。
  • 专家设计:采用 Multi-Head LatentMoE,将 3072 维隐藏表示拆成 12 个 256 维 head,每个 head 独立路由。36 层主体网络每层有 3072 个独立专家,每个 token 在每个 head 内选 6 个专家,合计激活 72 个小专家。相比主流 MoE 大模型每层数百个专家,颗粒度更细。
  • 系统工程:自研 MagiMoE kernel 库,把路由、排序、专家计算链路压在一起;并行策略改为 Head Parallel,在路由发生前按 head 分配计算,使设备间通信量不随激活专家数波动。优化器采用混合设计:矩阵参数用 Muon,专家参数用 AdamW。
  • 数据策略:从“层层过滤”转向“组织数据”,扩大有效数据规模,再通过更精细的标注让模型学习场景、动作、声音之间的对应关系。

值得关注

此次开源让研究者第一次能直接解剖千亿级视频 MoE,包括专家分工、路由稳定性和通信组织方式;对企业来说,多了一个可私有化部署和行业微调的选项,尤其适合金融、医疗、工业等数据敏感场景。开源与闭源视频模型之间的竞争,也可能从单纯的效果比拼扩展到部署可控性和开发者生态。当前发布的是 preview 版本,正式版仍待后续迭代。

开源地址:https://github.com/SandAI-org/MAGI-2-preview

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。