百万小时数据难证价值,具身智能数据竞赛指向效率

2026/08/19 12:25阅读量 3

虎嗅AI 100闭门会第八期聚焦具身智能数据,与会嘉宾认为“百万小时”数据规模难以验证,数据效率比规模更重要;真实场景下数据需具备可解释性、难例密度和跨本体复用性,数据公司需建立持续学习闭环才能走向商业落地。

事件概述

虎嗅AI 100闭门会第八期以“具身智能数据”为主题,来自酷哇科技、千寻智能、光轮智能、刻行时空的嘉宾讨论了数据规模、数据效率、数据金字塔、触觉与仿真、VLA与世界模型路线、商业化落地以及数据公司护城河等议题。

核心信息

  • “百万小时”数据规模缺乏验证:行业常见“十万小时”“百万小时”甚至“一亿小时”的判断,多从语言模型Token量换算而来,当前无法验证或证伪。有效指标不是时长,而是数据的信息增益是否超过采集成本,以及能否填补模型能力缺口。
  • 数据效率比规模更重要:熟练采集员一天8-10小时产出的有效视频约三分之一到二分之一;重复或低质量数据信息增量接近零,甚至污染训练集。例如,普通道路跑100公里对模型的信息增益可能接近零,而菜市场路口一只塑料袋却可能暴露不同传感器对柔性障碍的判断差异。规模化数据需要强自动标注和人工介入,人的精力应集中在模型最困惑、信息增益最高的样本上。
  • 数据金字塔重构:底层是跨本体的互联网人类视频,中间是仿真数据用于扩展失败样本、重建极端情境,顶层是真机部署产生的高价值难例。三层需形成循环;纯人类视频缺少机器人末端物理交互信息,需配合UMI类设备和真机数据。
  • 触觉与仿真数据不可替代:触觉数据瓶颈在采集设备而非模型,已有FTP-1等约3000小时触觉数据集探索。仿真可覆盖核电站、机械臂内部应力等现实无法反复采集的极端场景,提供普通视频中没有的物理监督信号,部分场景下是唯一可规模化获取的数据源。
  • VLA与世界模型短期不是二选一:千寻实验发现,数据量达到一定规模后,VLA与world-action model效果未必有本质差距。长期看,高层“大脑”可能收敛,低层“小脑”因控制频率、时延、功耗等硬件限制仍需分化,多模型协作和分层agentic系统更现实。
  • 商业化落地优先轮式底盘:轮式底盘加升降机构可能足以覆盖当前95%以上任务,客户关注ROI而非是否“像人”。上一代自动化是改造环境让环境适应机器,这一代则要让机器适应人类社会。To B需要“模型+人工接管+数据回流+自动迭代”的系统,远程监督员“一拖N”模式是衡量ROI的关键指标。
  • 数据公司护城河是持续学习闭环:数据公司需将采集、筛选、训练、部署、失败回流串成工程闭环,数据应从trajectory升级为experience,记录失败原因和恢复策略,并具备跨本体可迁移性,避免为每款新机器人从零开始。

值得关注

  • 当下具身智能数据竞争正从规模竞争转向效率竞争。人类视频提供规模,真机难例提供价值,仿真覆盖无法采集的场景,触觉补上视觉看不见的物理信息,没有一种数据能单独解决所有问题。
  • 在落地场景上,高度定制化的工业场景利润空间有限,高度自由的家庭场景尚未形成商业闭环,更现实的是中间地带的商服和部分工业场景。
  • 下一阶段分水岭不是谁先攒够100万小时数据,而是谁先建立持续学习闭环,把真实世界里昂贵、偶发的失败转化为模型下一次不再重犯的经验。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。