亮源新创发布三项Physical AI技术:构建从预训练到部署的规模化闭环
2026/09/13 15:38阅读量 2
亮源新创近期连续发布LightParkour、LightNav-0和Light REACT三项技术,旨在解决具身智能能力规模化扩展与真实部署问题。其中LightNav-0通过Real2Sim2Real引擎将2000+真实场景转化为仿真数据,实现零样本迁移至四种不同本体机器人;LightParkour利用物理仿真扩展接触技能分布;Light REACT则通过全身上下文学习提升机器人在扰动和损伤下的韧性控制。这三项技术共同构成了“规模化预训练-对齐-部署”的学习闭环。
事件概述
过去一年,具身智能(Embodied AI)技术迭代加速,行业关注点从单一技能的“会做”转向在开放环境中长期、稳定、泛化的“做成”。亮源新创提出Physical AI的“三段范式”,即规模化预训练(Scalable Pre-Training)、规模化对齐(Scalable Alignment)和规模化部署(Scalable Deployment),试图建立从训练、对齐到真实部署的学习闭环。过去一个多月,该公司连续发布三项技术成果,分别对应这一路径的不同阶段。
核心信息
1. LightParkour:技能从单点到分布的Scaling
- 痛点:传统动作模仿难以处理复杂接触任务(如跑酷),且针对不同障碍需重新采集数据,成本随技能线性增长。
- 方案:从简短的人类动作片段出发,结合物理仿真与课程学习。系统以45厘米障碍物初始动作为种子,通过仿真自动扩展至75厘米障碍(约Lightbot 0身高90%),生成覆盖不同环境条件的技能分布。
- 统一策略:采用多专家蒸馏,将行走与复杂接触技能整合进一个统一的循环深度视觉策略。模型仅依赖胸前深度相机和本体感知,以50Hz频率运行,无需外部参考轨迹或人工状态机切换,实现了技能的自主调用。
2. LightNav-0:通用导航的零样本泛化
- 数据引擎:通过Real2Sim2Real引擎,将互联网来源的2,000+个真实场景转化为可复用仿真环境,生成4,000+小时的视觉、语言和动作后训练经验。实验表明,扩大环境覆盖度比单纯增加同环境轨迹更能提升泛化能力。
- 推理机制:引入Point CoT(空间推理),将导航过程分解为“视觉语言理解→空间推理(预测目标点和可通行点)→动作生成”。在8项消融评测中,平均任务成功率提高8.4个百分点,SPL提高5.7个百分点。
- 统一表示:使用RVQ动作编码器将连续轨迹压缩为3个动作Token,使视觉、语言、空间和动作进入统一模型框架。
- 零样本迁移:同一模型成功零样本迁移至人形、四足、轮式和飞行机器人四种不同本体,验证了跨本体泛化能力。
3. Light REACT:面向异常状态的韧性控制
- 核心机制:全身上下文学习(Whole-Body In-Context Learning)。模型不依赖预设的故障标签,而是通过Transformer结构分析过去64帧的本体感知和交互历史,推断当前身体动力学状态(如执行器失效、关节锁定等)。
- 偏好对齐:在多教师蒸馏整合不同损伤状态的控制策略后,引入**偏好强化学习(Preference RL)**进行对齐。模型学会在身体条件允许时优先保持直立运动,仅在无法直立时切换至爬行等替代方式。实验显示,直立行为比例从42%提升至76%,显著减少了不必要的降级行为。
值得关注
- 技术路线的一致性:三项技术虽方向不同(运动、导航、控制),但均围绕减少人工适配、利用物理规律自动生成经验、以及建立统一模型体系展开。
- 闭环形成:规模化预训练建立基础能力,规模化对齐(如RL)提升性能,规模化部署产生真实世界数据(包括异常状态),这些数据回流至训练体系,驱动模型持续迭代。
- 行业对比:该路径与Skild AI的S1、Generalist AI的GEN-1.5等技术趋势一致,即从“收集数据-微调”转向利用大规模预训练形成的少样本/零样本适应能力,但Light REACT进一步聚焦于机器人自身身体状态变化的上下文推断。
