智象未来发布交互式世界模型HiDream-O1-World,登顶WBench空间导航榜
2026/08/17 16:46阅读量 2
智象未来发布基于原生全模态UiT架构的交互式世界模型HiDream-O1-World,支持文本、图像与交互式操控输入,可生成时空一致、符合物理规律并可长时推演的完整世界。该模型首次参评WBench即在Navi分榜以80.9分登顶,物理维度73.3、一致性维度88.0均领先,相关论文入选ECCV 2026。
事件概述
智象未来发布交互式世界模型 HiDream-O1-World,基于自研原生全模态(UiT)架构。模型具备漫游、编辑、交互三大功能,支持文本、图像、交互式操控等多模态输入,用户通过一段描述、一张图片或简单交互即可生成时空一致、符合物理规律、可长时推演的完整世界。
核心信息
- 模型核心突破在于时空一致性与物理一致性。UiT 架构升级后,镜头推拉摇移时场景几何结构保持高度稳定,物体不消失、不变形;碰撞、遮挡、重力响应符合真实世界因果逻辑。
- 在美团 LongCat 团队与复旦大学联合推出的 WBench 评测基准中,HiDream-O1-World 首次参评即登顶 Navi 分榜,平均分 80.9;Physical(物理)维度 73.3 分位列第一,Consistency(一致性)维度 88.0 分。WBench 是业内首个面向交互式世界模型的系统性评测基准,覆盖 289 个多轮交互案例、共 1058 个交互轮次,包含五大维度、22 项指标;Navi 分榜聚焦空间导航与视角控制,是衡量世界模型空间理解能力的核心标尺。
- 技术路线采用“3D 先验注入 Memory 上下文”与“Test-Time Training 在线维护”协同设计:模型在 Memory 中持续记录场景空间结构,镜头移动时按记忆调取对应视角画面,并通过在线微调保持生成稳定。训练阶段引入物理模拟数据驱动归纳偏置,推理阶段通过 TTT 在线适应场景物理属性。
- 在画面运动视觉合理性评测中,模型相比行业平均提升 13.6%;在流体、碰撞、形变等因果保真度评测中提升 12.7%。
- 聚焦空间一致性研究的论文《DreamWorld: Geometry-Grounded Video Diffusion for 3D-Consistent World Modeling》入选 ECCV 2026。
功能与应用
模型支持第一人称和第三人称视角漫游,用户可自由驱动角色并调整视角,也可实时编辑画面:驱动角色抓取、奔跑、下蹲、跳跃,或触发降雨、物体坠落等环境事件。模型支持人类、动物、虚构角色等角色构建,并能生成真实街景、自然地貌、室内空间以及幻想世界、二次元、3A 游戏渲染等多元风格。
产业方向上,HiDream-O1-World 可用于 AI 互动影游、具身智能仿真(机器人训练、自动驾驶、智能制造等)和 3D 场景生产,还可通过高精度微观世界模拟辅助药物发现与疾病机理研究。
