BeingBeyond发布Being-H0.8:首个隐式触觉世界动作模型,50万小时视频驱动

2026/07/28 13:25阅读量 6

智在无界(BeingBeyond)发布Being-H0.8,这是首个基于人类视频数据训练的隐式触觉世界动作模型。模型将触觉纳入“预测—执行—反馈”闭环,预判接触后根据实时触觉调整动作。数据方面,团队汇集超过50万小时第一人称视频,形成UniHand-3.0数据集,并通过TactoHand从视频中恢复接触信息、压力手套补充压力信号,再经通用触觉编码器和TopoHand统一表征。在真实双臂机器人上,模型完成了包中取物、毛笔写字、挤牙膏等精细任务。团队创始人卢宗青为北京大学副教授,公司成立于2025年5月。

事件概述

2026年7月28日,BeingBeyond(智在无界)发布Being-H0.8,这是首个基于人类视频数据的隐式触觉世界动作模型。该模型将触觉融入“预测—执行—反馈”完整链路:先根据当前画面预判可能发生的接触,执行过程中读取最新触觉反馈,实时调整下一段动作。

数据基础:50万小时视频与UniHand-3.0

数据是核心壁垒之一。团队汇总数十家合作伙伴的数据,建立超过50万小时的原始数据池,经过过滤、去重、切分、语言标注和分布再平衡后,形成高质量数据集UniHand-3.0。这是国内目前规模最大的人类操作视频数据池。

针对视频缺少触觉标注的问题,团队设计了四步pipeline:

  1. TactoHand:利用手与物体间的三维几何关系,从普通第一视角视频中预测稠密伪触觉监督(接触位置和邻近度),训练数据包含21个人-物交互数据源、共3010万帧。
  2. 压力手套传感器:补充约55小时、540万同步帧的真实压力信号,映射到统一手部表面。
  3. 通用触觉编码器:将不同粒度、不同来源的触觉信号(接触、邻近度、压力等)映射到统一的触觉token,通过Perceiver结构压缩为固定数量。
  4. TopoHand:统一人手、灵巧手和平行夹爪的动作空间,将手部表示拆分为手腕位姿、形态编码、20个规范关节角和夹爪张开量。

模型架构

Being-H0.8由四个核心模块组成:

  • Mixture of Transformers (MoT):负责预测交互后果,训练时利用未来触觉token辅助理解接触后的世界状态变化,部署时提前预测。
  • 慢—快动作专家:慢速流维持整体任务与动作计划(视觉、语言、隐世界状态等),快速流根据最新状态和触觉反馈只重算下一小段动作,既保证效率又兼顾实时纠偏。
  • 通用触觉编码器:统一不同传感器输入的触觉信号。
  • TopoHand:对齐不同本体的动作表示。

实验成果

在真实双臂机器人上,Being-H0.8成功完成依赖触觉的高难度精细任务,包括包中取物、毛笔写字、挤牙膏、夹薯片等。

团队背景

BeingBeyond成立于2025年5月,创始人卢宗青是北京大学计算机学院长聘副教授、智源学者,长期从事强化学习和多模态模型研究。团队最早探索利用大规模人类视频训练具身模型,经过从Being-H0到Being-H0.8的迭代,持续解决人类视频如何规模化、高质量用于具身模型训练的问题。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。