蚂蚁灵波CEO朱兴:具身智能尚未跨越“数据鸿沟”,机器人尚难适应非结构化环境

2026/09/16 12:04阅读量 3

蚂蚁灵波CEO朱兴指出,当前具身智能仍处于冷启动阶段,核心瓶颈在于数据质量与泛化能力不足,导致机器人难以应对如药房、小卖部等复杂开放场景。他强调通用基模的价值在于提升少样本学习效率,但需解决“吃不了粗粮”的问题,即无法直接利用互联网或非专业采集的低质数据。未来商业化将聚焦于生产力场景的规模化复制,通过构建异常数据回流闭环来降低后训练成本。

事件概述

在2026外滩大会期间,蚂蚁灵波CEO朱兴接受专访,深入探讨了具身智能落地的现实挑战与技术路径。他指出,尽管自主格斗等演示展示了机器人的临场反应进步,但在药房拣选、物流分拣等日常任务中,机器人仍面临包装各异、环境动态变化及意外频发等难题。目前行业处于“冷启动”阶段,能力和成本双重制约了大规模落地,尤其是像小卖部这样看似简单实则复杂的场景。

核心信息

1. 技术路线:坚持原生具身基模研发

  • 拒绝简单微调:早期尝试基于数字世界视频生成模型(如Wan)微调,发现存在上限低、破坏先验知识、泛化性降低等问题。因此,灵波转向从头训练原生具身基模。
  • LingBot系列架构
    • LingBot-World:生成可交互世界的基座模型,已开放1.3B小版本以贡献社区。
    • LingBot-Video:面向具身的视频生成基座,融入大量真实机器人数据。
    • LingBot-VLA 2.0:基于上述视频模型训练的动作模型。
  • 物理规律优先:区别于数字世界对画质和特效的追求,具身模型必须严格符合物理规律,并具备高性能实时处理能力,不能容忍“矿泉水跳舞落入手中”这类违背物理常识的输出。

2. 数据困境:“吃不了粗粮”与数据配方

  • 数据质量重于数量:朱兴认为Scaling Law不能机械看待,数据分布不均会导致效果差异。当前机器人无法直接使用互联网视频或仿真产生的“粗粮”数据,因为缺乏必要的精度和物理一致性。
  • 定制化采集策略
    • 摒弃购买成品数据,转向定制化采集,通过优化作业流程和端到端自动化管线,将数据可用率从15%提升至90%以上。
    • 采用流式交付模式,缩短数据从生产到训练的周期。
  • Ego数据采集局限:虽然第一人称视角(Ego)能增加场景多样性,但裸手轨迹重建误差大。看好结合高精度触觉手套的方案,以实现视觉与触觉信息的天然对齐。
  • 数据配比逻辑:预训练阶段使用无本体数据扩大泛化,后训练阶段使用贴近机器人的真实数据提升成功率,仿真数据主要用于中后训练强化特定任务成功率。

3. 商业化与应用场景

  • 首选药房试点:选择国大药房作为试点,解决白天药师被外卖订单占用、夜间人力不足的问题。该场景涉及人机安全、数千SKU商品泛化及狭窄通道(80厘米)通行,具有商业需求且能牵引技术进步。
  • 构型泛化而非执念人形:反对“机器人必须像人”的第一性原理。重载作业与轻量分拣应适配不同硬件构型以控制成本。家庭服务需求多样,无需统一形态。
  • R系列本体战略:保留自研R系列机器人用于生活服务探索,因蚂蚁集团核心业务围绕生活服务,需提前探索家庭场景下的通行、避障及安全力控问题,但不涉足工业主流出货场景。
  • 后训练降本增效:通用基模的核心价值是提升少样本表现,用更少数据达到更高成功率,从而降低跨门店复制的后训练成本。

4. 行业判断与未来展望

  • 数据飞轮现状:目前依赖人工数采强制喂数据。真正的飞轮需等待应用规模形成,依靠异常数据回流驱动迭代。成功数据意义有限,失败案例才是改进关键。
  • 大模型厂商入局影响:通用大模型公司(如OpenAI)虽具训练优势,但具身智能的核心壁垒在于数据理解、管线建设及物理世界交互,短期难以被颠覆。
  • 商业化节奏:不过度追求短期收入,而是通过有限的付费商业化验证技术成熟度。预计今年下半年至明后年,生产力应用量将快速增长,后训练数据成本有望指数级下降。
  • “Chat”比“GPT”更重要:强调闭环运行的重要性。具身智能需要像ChatGPT一样进入实际对话/交互循环,而非仅停留在模型能力展示。只有当机器人带来的帮助大于其所需的照顾时,用户才会买单。

值得关注

  • 异常数据回流机制:如何建立有效的机制,让部署在外的机器人将失误转化为后续模型的训练经验,是兑现“通用”价值的关键。
  • 人机协作边界:早期落地场景中,需明确哪些能力由机器承担,哪些需要人类兜底,避免将训练成本转嫁给使用者,特别是在家庭等非专业环境中。
  • 触觉感知融合:高精度触觉手套与视觉信息的结合,可能是解决Ego数据采集精度问题、提升模型泛化能力的重要突破口。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。