智象发布具身世界模型HiDream-O1-Embodied,登顶RoboColiseum扰动适应榜单

2026/09/07 14:03阅读量 3

智象未来(HiDream.ai)正式发布具身世界模型HiDream-O1-Embodied,标志着其打通图像、视频、3D、动作等模态,构建统一世界模型基座的技术闭环。该模型在具身智能评测平台RoboColiseum的“扰动适应”子榜单中以0.692分的成绩登顶榜首。通过原生全模态架构及“真实基座+生成增强”的数据策略,模型在语言理解、视觉感知和高容错执行方面实现了显著突破。

事件概述

今日,智象未来(HiDream.ai)正式发布具身世界模型 HiDream-O1-Embodied。该模型秉承原生全模态技术理念,旨在强化机器人的物理感知与动态预判能力,助力具身智能实现更高阶的物理交互。此次发布意味着智象已逐步实现从图像、视频、3D到动作等多模态的贯通,完成了“理解—推演—执行”全流程的统一世界模型基座构建。

核心成绩:RoboColiseum榜单登顶

在模型发布同期,HiDream-O1-Embodied 首次参评具身智能模型评测平台 RoboColiseum,并在核心的 Robustness(扰动适应) 子榜单中取得优异成绩:

  • 排名:以平均分 0.692 的成绩登顶榜首。
  • 评测背景:RoboColiseum 是一个常态化具身智能仿真评测平台,基于高保真仿真环境构建,涵盖指令跟随、空间理解、扰动适应与通用操作四个维度。其中,“扰动适应”被公认为最具挑战性的一环,通过改变背景、光照、材质、机器人初始状态、相机位置及图像质量等非理想条件,检验模型在复杂环境中的稳定性与泛化能力。

技术突破与创新

HiDream-O1-Embodied 能够应对真实世界中的各类“意外”,主要得益于其在以下三个方面的突破性创新:

  1. 语言理解:突破关键词匹配局限

    • 传统机器人往往依赖关键词匹配,对句式变化敏感。HiDream-O1-Embodied 覆盖多元动词、句式与表达方式的等价指令空间,能够穿透字面意思,锁定用户意图本身,从而适应多样化的指令表达。
  2. 视觉感知:多视角协同机制

    • 针对物理世界中相机偏移、标定误差或画面遮挡等问题,模型综合多个视角的信息进行互补。当部分视觉通道失效时,系统仍能借助其他视角理解场景并继续执行任务,避免了“一处失灵、全局失效”的情况,实现“局部受限、整体仍可运行”。
  3. 高容错机制:非理想条件下的稳定执行

    • 模型在训练阶段主动引入光照变化、画面污损、视野遮挡和信号波动等非理想条件,使其学会从有限且不完美的线索中作出可靠判断。这种训练使模型不仅追求理想条件下的最佳表现,更重视在复杂环境中持续稳定的执行能力。

数据策略:“真实基座 + 生成增强”

智象采用“模型+数据”双驱动策略,将数据生产作为模型迭代的有机一环,形成了“真实基座 + 生成增强”的数据生产范式:

  • 真实底座:通过与诺亦腾(Noitom)合作,利用高精度真人动作捕捉数据作为基础。
  • 生成增强:借助原生全模态能力,在严格恪守物理约束不变的前提下,对单段真实动作样本进行百倍级精细化扩增。模型可生成变体视频,切换背景环境、光照条件、物体形态等变量,产出海量多元训练样本。
  • 飞轮效应:模型既作为“考生”接收数据,也作为“出题人”主动生成针对性训练样本,形成数据与模型互相驱动的增长飞轮,显著提升了面对现实世界强扰动时的鲁棒性。

战略意义

HiDream-O1-Embodied 的发布是智象原生全模态世界模型矩阵的重要一环。此前,智象已发布交互式世界模型 HiDream-O1-World,解决了数字世界中的“理解与推演”问题;而 HiDream-O1-Embodied 则聚焦物理世界中的“操作与执行”。两者互补,共同筑牢了原生全模态世界模型的发展根基,体现了智象从单模态走向原生统一全模态的技术演进路径。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。