MiniMax发布开源视频模型H3:手绘即特效,视频后期进入端到端生成

2026/07/31 16:28阅读量 4

MiniMax正式发布新一代视频模型H3,也是其首个开源视频模型。H3将剪辑、字幕、转场、节奏、背景音乐与视觉特效端到端集成到模型中,输入文本即可生成可发布的2K成品,并支持图片、音频、视频等全模态输入。该模型在Artificial Analysis视频编辑榜单登顶,2K分辨率下每秒价格不到主流模型的三分之一。

事件概述

  • MiniMax发布新一代视频模型H3,为首个开源视频模型,支持全模态输入(文本、图片、音频、视频),输入文本可直接生成包含剪辑、字幕、转场、节奏、背景音乐和视觉特效的成品视频,默认清晰度2K。
  • H3在Artificial Analysis视频编辑榜单中排名第一,也是该榜单中唯一开放权重的模型。

核心能力

  • 手绘特效与片头:可通过文本描述生成手绘风格视觉特效、动态片头、花体字和复杂字幕动画,并能理解用户想要的视觉与剪辑风格。
  • 长指令与多分镜遵循:能够严格遵循包含六个分镜的长prompt,每个分镜可指定情绪方向与表演逻辑。
  • 视频内文字生成:文字在连续帧中保持稳定形态,达到可商用水平;并能理解文字与画面关系,例如让文字呈现光影变化和景深过渡。
  • 音频驱动台词:支持输入音频让模型“读台词”,声音会跟随画面情绪和节奏变化,而非生硬TTS念稿。
  • 精准编辑与可控性:模型在语义层面对画面、动作、风格、空间关系进行综合理解,从而提升生成稳定性与可控性,降低“抽卡”式的不确定性。

技术要点

  • MiniMax定制了Caption模型,建立了全模态理解管线。Caption不再只是描述目标视频,而是同时刻画上下文与目标视频的关系,以及上下文内部各元素之间的关联,形成上下文Omni表征。
  • 采用原生Omni架构“H3-Omni Transformer”,面向多模态场景的通用与高效设计。

价格与开源

  • API定价方面,H3在2K分辨率下每秒价格不到主流模型的三分之一,在768P分辨率下不到二分之一。
  • H3为开源模型,支持私有化部署和自有数据微调,便于围绕核心IP、品牌画风与专属内容工作流进行定制。
  • MiniMax从文本模型M2系列起持续开源,H3将开源推进到视频生成领域。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。