生数科技Motus2:构建具身智能闭环,探索机器人递归自我进化

2026/09/12 16:15阅读量 2

生数科技发布世界模型Motus2,通过整合行动、预测与评估能力,实现基于递归自我改进(RSI)的闭环自进化机制。该模型引入触觉专家模块与记忆缓存机制,并采用大规模人类第一视角(Ego)数据预训练结合机器人适配的策略,显著提升了灵巧操作成功率。真机测试显示,结合规划与强化学习的策略使任务成功率提升10个百分点,验证了从“能行动”向“会反思”演进的技术路径。

事件概述

生数科技发布了新一代世界模型 Motus2,旨在解决具身智能中机器人缺乏因果认知和持续学习能力的痛点。与传统仅依赖“状态-动作”统计关联的模型不同,Motus2 构建了包含行动生成、后果预测和价值评估的闭环系统,初步实现了递归自我改进(Recursive Self-Improvement, RSI)。该模型在视觉、语言、动作及触觉等多模态融合上进行了深度拓展,并在高自由度灵巧手平台上完成了多项复杂任务的部署与验证。

核心信息

1. 闭环自进化机制(RSI)

Motus2 的核心突破在于将三种关键能力整合于同一模型中,形成反馈闭环:

  • 行动(WAM):世界动作模型负责根据当前状态生成下一步动作。
  • 预测(AC-WM):条件动作世界模型用于预测执行动作后的环境变化。
  • 评估(VM):价值模型对预测结果进行打分,判断动作优劣。

技术实现路径:

  • Action-first 信息流:严格遵循“先观测生成动作 -> 再预测后果 -> 最后评估结果”的时序逻辑,防止模型在训练中出现利用未来帧反推当前动作的“作弊”行为。
  • 推理阶段 Best-of-N 规划:模型生成多个候选动作,分别模拟其后果并由价值模型打分,选择最优方案执行。这类似于基于模型的强化学习(MBRL)中的模拟优化。
  • 训练阶段策略更新:将候选动作的评分转化为策略更新信号,仅更新动作相关参数,保留预测和评估模块的稳定,从而实现基于反馈的策略迭代。

效果验证:
在手机放置和多指操作的真机任务中,基础策略成功率为 65%;加入规划后提升至 67.5%;加入 MBRL 后达到 72.5%;两者结合最高达 75%,较基础策略提升 10 个百分点。

2. 全模态增强:触觉与记忆

为弥补纯视觉感知的局限,Motus2 引入了触觉和记忆机制:

  • 轻量级触觉专家模块:复用主模型中间结果以兼顾计算效率,在短动作片段前读取最新触觉反馈以细化动作。在抽取纸杯和撕纸任务中,加入触觉后平均成功率从 60% 提升至 72.5%(+12.5%)。
  • 记忆缓存机制:针对需要长期上下文的任务(如寻找隐藏物体),默认缓存近期真实观测而非压缩历史。实验表明,保留完整历史信息的方案在相关测试中平均成功率达 57.5%,显著优于压缩方案,证明历史信息是决策的关键组成部分。

3. 数据体系:Ego 数据迁移

Motus2 采用多层次的人类第一视角(Ego)数据体系进行训练,以解决高自由度灵巧手的数据稀缺问题:

  • 训练三步走
    1. 单目 Ego 视频预训练:利用大规模人类操作视频学习基础物理规律。
    2. 双目视频与人类动作数据:学习细粒度的手部交互信息。
    3. 机器人领域适配训练:使用机器人轨迹和人机对齐数据进行控制空间迁移。
  • 规模与效果:数据集包含约 13 万小时人类第一视角数据和百小时级机器人数据。对照实验显示,仅经人类 Ego 数据预训练的模型五项任务平均成功率为 51%,加入机器人中间训练后跃升至 84%(+33%)。
  • 数据扩展性:增加双目数据量(从 2000 小时至 20000 小时)可持续降低人类动作预测误差,未见明显性能天花板。

值得关注

  • 能力层级定位:按照生数科技提出的世界模型五级演进路线(L1-L5),Motus2 已具备 L3 “在世界中行动”的核心能力,并开始触碰 L4 “自主世界智能体”中关于自主反馈和自我改进的关键环节。
  • 失败数据的价值重构:在闭环机制下,失败轨迹不再被视为噪声,而是用于学习动作后果与评价,帮助模型识别无效动作,改变了传统高度依赖完美示范的数据处理范式。
  • 局限性与挑战:尽管取得了进展,但从单次任务优化到开放世界的长期自主学习仍有距离。触觉数据在不同本体间的迁移、长任务预测的可靠性以及长期记忆的效率仍是待解难题。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。