押注端到端双足人形机器人大脑:一支全是博士在读年轻人的创业团队
一段机器人驾驶卡丁车全自主过弯的视频引发关注,背后是成立仅两个月的初创公司共生知行。团队全员为在读博士,押注双足人形机器人的端到端感控一体化基座模型,认为分层架构存在信息瓶颈、无法实现真正的Scaling,并提出DriftDistill等机制应对全身动力学控制挑战。
事件概述
近日,一段机器人驾驶卡丁车在赛道上连续过弯、加速、打方向的全自主视频引发业内关注。与常见的慢速抓取演示不同,该机器人能够手眼脚协同,在高速运动和多接触点平衡条件下完成精细力控。视频发布方为初创公司共生知行,其核心方向是双足人形机器人的端到端感控一体化“大脑”,即基座模型。
公司将创始人丁鹏翔出生于1996年,核心团队成员均为00后,全员博士在读,公司成立刚满两个月。团队此前在具身智能领域曾获两项Best Paper、一项Best Paper Candidate,并打造了国内首个GitHub Stars突破2K的具身基座模型。
核心信息
技术路线:押注纯端到端,放弃分层架构
丁鹏翔表示,团队早在2023年12月便开始为四足机器人构建“大脑”,其提出的QUAR-VLA是首个面向四足机器人的VLA任务范式,采用“大脑负责理解、小脑负责运动执行”的分层思路。但后续研究发现,分层架构存在先天缺陷:大脑与小脑分开训练、再拼接,整体并非最优;两层之间的信息翻译会产生级联误差和信息损失。丁鹏翔判断,分层的接口设计决定了其无法实现真正的Scaling。因此,团队选择更激进的纯端到端路线,直接让模型从数据中学习“感知—理解—行动”的完整过程。
技术分水岭:从运动学到动力学
当前多数机器人基座模型仍以运动学为主,即关心手移动到哪里、是否抓住目标。但双足机器人执行任务时,身体重心动态变化,下蹲、伸臂等动作需要腰部、踝关节和腿部协同调整力度以保持平衡,模型面对的是全身动力学问题。以G1双足人形为例,其拥有29个自由度,远超机械臂的7个自由度。共生知行选择将模型直接输出到关节目标层(Joint Target),去掉分层方案中“大脑输出运动学目标、小脑解算关节动作”的中间环节,让模型直接面对几十个关节的身体状态。
稳定与力控:DriftDistill与Force Expert
为解决去掉小脑后机器人易摔倒的问题,团队提出“任务行为建模—运动先验蒸馏”双域协同优化机制。一条通路延续行为克隆保证任务精度;另一条通过DriftDistill将底层控制器的稳定性、抗扰动与Failure Recovery能力转化为统一模型的内生运动先验。该机制并非简单叠加两个Loss,而是让模型同时获得任务智能与身体智能。团队将这一能力汇聚模块称为Motion Expert(运动专家模型),目前规模接近1B。此外,团队还规划了Force Expert作为安全接触专家,学习施力、柔顺、阻抗和接触反馈,再通过策略蒸馏融入端到端模型,以解决机器人输出力的问题。
数据与展望
全球合规机器人数据截至2026年初约50万小时,不足大语言模型数据的二万分之一,且大量数据为站定操作,缺乏全身移动操作所需的强耦合数据。共生知行公开了约1万多小时数据,自采数千小时,并提出TrajBooster方法:从机械臂或轮式机器人提取末端轨迹,让人形机器人在仿真中追踪轨迹并保持平衡,从而复用机械臂的任务多样性,低成本扩展预训练数据。
丁鹏翔认为,约十万小时数据可能仅支撑实验室级Demo,真正具有大规模商业意义可能需要百万小时级数据。行业目前仍在竞争合适的数据采集形式,包括肌电、外骨骼、动捕、Pico遥操等。他表示,当前人形机器人最难的问题有三个:感知与控制如何结合、应采用什么类型的数据、以及数据规模本身。团队的愿景是未来由中国团队设计的机器人模型架构能被北美同行广泛采用,而非跟随硅谷路线。
