从170亿融资到100万小时数据:具身智能有效数据标准何在?

2026/08/12 11:25阅读量 2

2026年前7个月,具身智能融资超750亿元,数据公司半年融资170亿,但行业始终缺少“有效数据”的统一标准。8月17日,虎嗅AI 100闭门会将邀请四位一线操盘手,围绕数据来源、数据有效率与数据资产三组问题,讨论高价值具身数据应如何定义与生产。

事件概述

  • 2026年前7个月,具身智能领域融资超750亿元,为2025年全年的约4倍、2024年全年的约22倍(据IT桔子数据)。
  • 其中25家数据公司半年融资170亿元,行业热度高涨,但“有效关键数据”缺乏统一判断标准。
  • “100万小时”正成为具身智能的新尺度,但采集时长与训练可用产量之间存在明显落差,多数数据在两者之间被丢弃。

核心信息

  • 行业争论焦点在于:什么数据算“有效经验”?判断标准包括能否提升能力、能否跨任务/场景/本体复用、是否值得长期投入和持有。
  • 虎嗅AI 100闭门会将于8月17日19:00-21:00通过腾讯会议直播,邀请四位一线从业者,从四条链路讨论数据价值:
    1. 酷哇科技联合创始人彭湃:真实部署中的失败、接管与纠偏数据,如何转化为下一轮训练的高价值经验。
    2. 千寻智能预训练负责人郭俊良:人类视频、真机示教、仿真生成、部署回流等不同数据源的能力贡献如何量化,数据配方如何决定模型上限。
    3. 光轮智能战略与生态副总裁廉和:人类行为数据、物理测量、仿真数据如何形成闭环,评测如何连接训练与真实能力,以及物理AI基础设施的生态协作。
    4. 刻行时空联合创始人、CTO郑宇靖:跨本体、跨传感器的数据治理与评价如何建立信任,真实数据如何跨越工程、质量、合规门槛进入模型训练流程。

值得关注

讨论将聚焦三组核心问题:

  1. 数据来源:若数据预算为1亿元,四条数据路线应如何分配?人类第一视角视频、真机遥操作、仿真生成和真实部署回流,分别适合学习语义、意图、动作先验、接触、受力、失败恢复还是安全边界?
  2. 数据有效率:一小时采集数据中有多少能真正进入训练集?被丢弃的数据为何被丢弃?数据成本应按采集小时、有效轨迹、难例密度还是模型能力增量计算?
  3. 数据资产:本体变化后历史数据还剩多少价值?甲方、机器人公司、模型公司与数据服务商共同产生的数据归谁?可复售的数据能否构成护城河?

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。