MiniMax H3 实测:全模态精准控制,让 AI 视频更接近成片

2026/07/31 13:21阅读量 5

MiniMax 发布新一代开源视频模型 H3,支持图文音视频混合输入和全模态精准控制,能自动完成剪辑、包装、特效与局部修改,实测中可将产品截图、分镜图等直接转化为接近成片的商业视频。H3 在 Artificial Analysis 视频编辑榜上位列第一,开源策略旨在降低 AI 视频的生产成本和使用门槛。

事件概述

MiniMax 发布新一代开源视频模型 MiniMax H3,定位为“开放通用多模态视频模型”,支持文字、图片、视频和音频混合输入,一次最多可使用 9 张图片、3 段视频和 3 段音频,混合文件上限 12 个。H3 强调“全模态精准控制”和“AI 原生后期”,尝试将生成、剪辑、字幕、动效和声音等流程整合进同一模型,使输出更接近可交付的成片。

核心能力与实测表现

  • 多模态输入与自动成片:将 7 张产品截图和一段设计介绍视频输入 H3,仅用一句话提示词,即可生成一支工具介绍视频。模型会自动设计转场与动效,并保持产品主视觉一致。文字渲染准确率高,但在较小且密集的文本上偶尔出现乱码。此外,上述视频均为一次性生成,无需抽卡。
  • 精细提示词控制:用包含画面顺序、色彩(石墨黑、暖灰、荧光橙)、转场方式(形状变形、遮罩、卡片伸缩)和音效要求的详细提示词,H3 能生成一支虚构 AI 设计工具的品牌片,英文单词拼写正确,品牌色全程保持,并自动配乐和同步音效。
  • 分镜图转视频:将模糊的横版分镜图交给 H3,它能读取信息并重新布局画面,且把文字作为视觉设计元素融入场景(如将产品名称放在机身下方),而不是简单叠加。
  • 商业场景覆盖:H3 可生成游戏 HUD 界面、产品介绍视频、时尚品牌片等。指定模特、背景和音乐后,生成的视频在去除水印后难以辨别为 AI 制作;上传产品主图即可生成商业广告片,并自动添加音效和配音。
  • 精准局部编辑:H3 支持在保留原视频人物动作、光影、表情和镜头视角的前提下,将背景从音乐厅替换为草原或海边;可将小提琴换成二胡,甚至让乐器消失;还可对同一画面中的不同对象分别指定修改(如左边换衣、右边变狗);也能仅调整摄像机角度,同时保持其他元素不变。

榜单与开源意义

在 Artificial Analysis 的全球视频编辑榜上,MiniMax H3 发布即超越 Gemini Omni 等模型,位列第一。MiniMax 选择开源 H3,使企业和创作者能够以更低成本搭建自主可控的视频生产能力,而不必依赖高价 Token 采购。AI 视频的竞争正从单纯追求画质和电影感,转向完善创意生成、精准编辑、包装和修改等完整生产链路;H3 代表了这一新赛道的方向。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。