智象未来发布HiDream-O1-Video-1.0:原生全模态架构突破物理规律与音画同步瓶颈
2026/09/15 18:41阅读量 4
智象未来正式发布首款物理规律导向视频生成模型HiDream-O1-Video-1.0(HD-V1),该模型基于原生全模态架构,支持文本、图片及视频输入,可一键生成5–20秒1080p高保真视频。在意图理解、物理规律模拟、自主叙事规划及音画一体化生成等维度实现全面升级。HD-V1在Artificial Analysis和Arena.ai两项国际权威榜单中分别位列第四和第八,标志着中国AI视频模型进入全球第一梯队。
事件概述
智象未来(HiDream.ai)于2026年9月15日正式发布首个原生全模态视频生成模型 HiDream-O1-Video-1.0(简称 HD-V1)。该模型采用自研原生全模态架构,旨在解决传统视频生成中意图理解偏差、物理逻辑错误及音画不同步等核心痛点。发布同期,HD-V1在国际权威评测中取得优异成绩,验证了其技术路线的全球竞争力。
核心技术与能力突破
1. 原生全模态架构与物理规律建模
HD-V1 并非简单的像素堆砌,而是从架构设计之初便面向文本、视频与音频的统一表征。其核心突破在于将真实世界的物理规律写入生成逻辑:
- 物理一致性:模型能够准确模拟重力、碰撞反馈、惯性延续、光影衰减及空间连续性。在对比测试中,HD-V1生成的物体形变(如线的张力与延展)符合真实物理反馈,避免了其他模型出现的“凭空生针”或“不合理缩短”等幻觉现象。
- 多模态联合建模:通过对文本、视频、音频信号进行联合建模,画面运动牵引声音节奏,台词与音效反哺镜头情绪,实现了真正的音画原生一体化,解决了后期拼接导致的音画错位问题。
2. 深度意图理解与结构化规划
针对用户口语化、碎片化的输入,HD-V1 前置了多模态意图理解模块:
- 结构化输出:模型能将自然语言转化为包含镜头时长、场景地点、角色动作、景别构图、音效设计等字段的专业规划。
- 先规划后生成:采用“先全局规划叙事与角色状态 -> 后联合生成约束画面/动作/语义 -> 最后以多模态 Reward 对齐”的技术思路,确保内容在整体叙事维度上的自洽性。
3. 自适应时长与高保真叙事
- 动态时长决策:HD-V1 摒弃了固定提示词时长的限制,根据事件展开逻辑和叙事节奏自行规划生成时长。例如在“抛接苹果”场景中,HD-V1 能自然完成动作周期,而非机械填充无意义的等待画面或慢放。
- 画质与连贯性优化:通过 Diffusion Reinforcement Learning 及人工认知对齐的多模态 Reward 模型,对音视频内容进行统一评估,提升了单帧质感及长视频的叙事连贯性。
行业地位与评测成绩
HD-V1 在全球两大独立 AI 基准测试平台中均位居前列,确立了其在 AI 视频领域的领先地位:
- Artificial Analysis Image to Video Leaderboard (With Audio):全球排名 第4。
- Arena.ai Image-to-Video:全球排名 第8。
生态布局与融资进展
随着 HD-V1 的发布,智象未来的“原生全模态世界模型矩阵”闭环正式成型,涵盖以下同源演进模型:
- 图像生成:HiDream‑O1‑Image 系列(商用版获 Artificial Analysis 文生图全球第二)。
- 交互式世界模型:HiDream‑O1‑World(WBench 综合总榜第一)。
- 具身世界模型:HiDream‑O1‑Embodied(RoboColiseum 子榜单登顶)。
与此同时,智象未来宣布完成 C+轮融资,投资方包括新微资本、交子资本和工银资本。本轮融资体现了资本市场对其原生全模态技术路线及产业化潜力的高度认可,旨在加速模型在智能终端与行业应用中的落地。
