穹彻智能联合阿里云搭建机器人数据生产线,破解具身智能“数据焦虑”

2026/08/07 17:40阅读量 3

穹彻智能联合阿里云推出云端自动化数据处理产线,将机器人原始数据从依赖人工、单机处理升级为规模化工业流程。该产线覆盖位姿恢复、相机标定、动作切分、语义标注等环节,实现全流程自动化,数据处理吞吐提升超10倍,模型训练效率提升约50%。

事件概述

穹彻智能与阿里云合作推出端到端 UMI Data + AI Pipeline,希望将机器人数据从采集到训练的处理流程,构建为一条可规模化运转的“数据生产线”。这一合作将此前依赖人工、单机运行的数据处理模式,升级为云端弹性调度的工业化流程。

背景:机器人数据的稀缺与处理瓶颈

具身智能的竞争焦点正从模型转向数据。与大语言模型可利用互联网文本不同,机器人需要学习真实世界的操作能力,一次抓取、搬运、整理任务都需要同步记录视觉、动作、轨迹等多模态信息。穹彻智能采用 UMI(Universal Manipulation Interface)方案进行数据采集,操作人员手持设备完成自然动作即可记录第一视角画面、夹爪位姿和运动轨迹。

采集后的数据处理是主要挑战。原始数据需要经历位姿恢复、鱼眼相机标定、动作切分、多模态标注等环节,其中视觉 SLAM 重建消耗大量 GPU 算力,鱼眼图像需逐帧去畸变,连续动作需切分为原子任务并添加语义描述。随着采集规模扩大,数百小时视频数据对计算带来巨大压力,且流程中断可能导致整批数据重算。

核心方案:云上自动化数据产线

为解决上述问题,双方搭建了端到端 UMI Data + AI Pipeline:

  • 阿里云 MaxCompute MaxFrame 提供分布式计算能力,将视频去畸变、SLAM 位姿恢复、多模态标注等任务拆分至云端并行执行,算力可随任务规模弹性扩展。
  • 大模型能力嵌入数据处理流程,实现动作片段的自动语义标注,降低人工标注成本。
  • DataWorks 统一编排调度,支持周期调度、历史数据重跑、异常自动恢复,减少人工干预。
  • Hologres 对处理后数据进行统一管理,为样本检索、数据审核和训练管理提供实时数据服务。
  • PAI 平台完成模型训练、性能优化和部署验证,形成从数据生产到模型训练再反馈的闭环。

实际效果与行业意义

合作带来的实际效果包括:数据处理全流程自动化,整体吞吐提升超过 10 倍;多模态标注实现规模化自动完成;云端算力可弹性扩展至 10 万+ CU;模型训练效率提升约 50%。

对具身智能行业而言,这验证了机器人数据也可以建立规模化、自动化的生产体系。当数据采集、处理、训练逐步标准化,机器人模型的迭代速度有望加快。行业竞争正从模型能力延伸到数据基础设施,数据生产能力将成为下一阶段具身智能发展的重要竞争力。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。