HSImul3R:首个可仿真的人-场景交互重建框架,打通视频到机器人技能链路

2026/09/10 15:57阅读量 2

大晓机器人联合南洋理工大学及上海人工智能实验室发布HSImul3R,解决三维重建中“视觉正确但物理失效”的感知-仿真鸿沟。该框架通过物理闭环双向优化机制,显著提升人-场景交互稳定率并降低穿模率,并将优化后的动作迁移至Unitree G1机器人,实现从人类视频到真实机器人执行的完整闭环。

事件概述

近日,大晓机器人(Daxiao Robotics)联合南洋理工大学 S-Lab 与上海人工智能实验室发布了全球首个面向非标定稀疏视角输入、支持单目视频输入的人-场景交互重建框架 HSImul3R。该成果已被计算机视觉顶级会议 ECCV 2026 接收。研究旨在解决传统三维重建系统存在的“感知—仿真鸿沟”,即视觉上准确的重建结果在物理仿真中往往因结构缺失或接触错误而失效的问题,推动三维重建从单纯的“视觉对齐”转向“物理可执行”。

核心技术与创新

HSImul3R 的核心突破在于引入了物理闭环(Physics-in-the-Loop)双向优化框架,将重力稳定性、真实接触和交互稳定性纳入重建标准,使物理仿真器从最终的验证工具转变为重建过程中的主动监督者。

  1. 正向优化:面向场景的强化学习 (Scene-targeted Reinforcement Learning)

    • 传统方法仅关注人体运动是否稳定或接近原始轨迹,容易导致动作偏离原有的物体交互关系(如为了平衡而离开椅子)。
    • HSImul3R 通过约束人体关键接触点与物体表面的空间关系,确保优化后的人体动作既符合动力学规律,又能与特定场景保持正确且稳定的接触,实现真正的“物理成立”而非仅仅是“动作可行”。
  2. 反向优化:直接仿真奖励优化 (Direct Simulation Reward Optimization, DSRO)

    • 针对图像生成三维模型时常见的结构缺失或几何畸变问题,该模块利用物理仿真的交互反馈作为监督信号,反向优化三维场景生成模型。
    • 评价标准从“物体自身能否站稳”升级为“人与物体交互后能否保持稳定”,只有当物体自身稳定、交互后仍稳定且存在有效接触时,重建才被视为成功。

性能表现与基准测试

团队构建了专门用于检验人-场景交互稳定性的基准数据集 HSIBench,包含19个场景物体、50多段人体动作序列及300个独立交互实例。实验数据显示,HSImul3R 在 Easy、Medium、Hard 三档任务中的表现显著优于基线方法 HSfM:

  • 交互稳定率:HSImul3R 分别为 53.68%30.56%13.92%,而 HSfM 仅为 10.52%、4.50% 和 2.66%。
  • 穿模率降低:人-场景三维穿模率从 HSfM 的 69.51% 大幅降至 22.90%

应用落地:从视频到机器人技能

HSImul3R 不仅停留在仿真层面,还实现了从虚拟到现实的迁移(Sim-to-Real),构建了完整的技能获取链路:

  1. 数据输入:日常图像或视频。
  2. 重建与优化:生成三维人-场景交互模型,并通过物理仿真进行双向优化修正。
  3. 动作迁移将优化后的人体运动重定向至 Unitree G1 人形机器人。
  4. 策略训练与执行:以重定向动作为先验,在仿真环境中训练全身控制策略,最终部署到真实机器人上执行。

这一流程证明了互联网中海量的人类行为视频可以转化为可仿真、可学习、可执行的机器人技能资产,为具身智能提供了新的数据来源和技术路径。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。