MiniMax 发布 H3 与 Design,试图成为视频领域的 Claude Code

2026/08/21 18:58阅读量 3

MiniMax 在发布 SOTA 级视频模型 H3 四天后,将 MiniMax Hub 升级为视频 Agent 产品 MiniMax Design。H3 用三段式架构提升视频生成与局部编辑可控性,Design 则自动拆解任务、调度多 Agent 完成创作,试图复刻 Claude Code 在编程领域跑通的模型+Agent 商业化路径。

事件概述

  • 7月31日,MiniMax 发布视频生成模型 H3,支持最高 2K 分辨率。截至8月中旬,H3 在 Artificial Analysis 视频编辑榜单上排名第一,在文生视频与图生视频榜单中处于第一梯队、全球前三。H3 定价为每秒 0.8 元,约为同类产品的三分之一;字节跳动旗下剪映海外版 CapCut 也在发布后接入该模型。
  • 8月3日,MiniMax Hub 升级为 MiniMax Design 并开始小范围内测,产品定位为「Your localized multimodal AI Agent team」。入口和任务执行均以 Agent 为核心,用户无需手动编写复杂提示词。

核心信息

H3 的三段式架构

H3 的可控性来自三段式结构:H3-Context-IR 负责语义理解与任务编排,可一次接收 9 张图、3 段视频、3 段音频作为上下文,将用户意图转成结构化指令;H3-Base 为 330 亿参数模型,负责视频内容生成;H3-Regenerate-2K 负责高分辨率重生成。这一设计使模型在视频质量、后期特效和局部修改方面具备更强可控性。

MiniMax Design 的 Agent 工作流

MiniMax Design 要解决的是生成效率提升后仍存在的提示词撰写和风格一致性问题。产品中的主 Agent 会判断创作意图、拆分任务并匹配模型,再由文案 Agent、图像 Agent、视频 Agent 并行执行;用户可在画布上继续调整、编排和组合结果。

产品内置大量针对 H3 的 Skill,能把模糊的自然语言指令扩写为 700 多字专业提示词,并判断哪些素材应作为参考、保留、增强或修改。对于专业用户,3D 导演台支持上传参考图和参考视频后调整角色素体、机位与姿态,快速搭建分镜参考;自动剪辑、自动添加字幕等操作可通过一句指令完成。

在 PV、MV 等叙事向视频中,产品会先锚定主题、音乐节奏与核心参考素材,统一视觉基调和分镜逻辑,再匹配人物、场景与镜头动作;在电影片头、特效包装等高专业度场景中,则会逐层拆分文字版式、图形视觉、镜头运动、转场特效,联动 H3 的原生生成、参考精准控制和视频精细化编辑能力。

值得关注

编程 Agent 已先验证了「完整任务入口」的商业价值:Cursor 在 2026 年仍保持 7 倍估值增速与 8 倍 ARR 增速;Claude Code 从 2025 年 5 月公开到 2026 年 2 月,ARR 达到 25 亿美元,约占 Anthropic 总营收的十分之一。

相比编程 Agent,视频 Agent 的价值只会更大,壁垒也更强:视频创作没有编译器那样的确定性反馈,素材与状态管理更复杂,局部修改无法靠回滚 commit 解决,重新生成会带来不可控成本。因此,模型需要具备多模态上下文理解能力,工作台需要把保留、修改、重生成做到顺滑。对买量素材、电商短视频、教育科普动画等批量生产场景,工作流效率提升远大于单镜头画质优化。

MiniMax 将 H3 与 Design 深度耦合,为其构建针对性 Skill 和创作工作台,这构成了 MiniMax 区别于竞品的核心壁垒。综合来看,MiniMax H3 与 Design 的组合距离成为视频领域的 Claude Code 式产品或许只有一步之遥。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。