前字节强化学习专家孙鹏加盟星尘智能,补齐Physical AI全栈布局
2026/09/02 14:06阅读量 2
9月2日,前字节跳动强化学习专家、前腾讯Robotics X智能体中心负责人孙鹏博士正式加入星尘智能,负责机器人强化学习方向的技术研发与应用探索。孙鹏拥有十余年强化学习及智能体研究经验,曾在字节主导开发ByteRL基础设施并参与大模型后训练研究。他的加入旨在完善星尘智能“AI模型+具身OS+本体”的全栈技术闭环,推动机器人在真实物理世界中的持续学习与策略优化。
事件概述
9月2日,孙鹏博士正式加入星尘智能(Stardust Intelligence)。孙鹏曾任字节跳动强化学习专家及腾讯Robotics X智能体中心负责人,此次加盟将重点负责机器人强化学习方向的技术研发与应用探索,以应对机器人从Demo演示走向真实部署和商业化过程中面临的稳定性挑战。
核心背景:行业痛点与技术转向
随着机器人基础模型逐步解决“会不会”的问题,行业焦点正转向“能不能稳定做好”。如何让机器人根据真实执行结果持续修正策略,成为关键命题,这也使得强化学习(Reinforcement Learning, RL)重新回到行业关注的中心。孙鹏的加入旨在通过强化学习技术,帮助机器人在真实环境中实现持续学习和进化。
人物履历与技术积累
孙鹏博士毕业于清华大学,并在康奈尔大学和罗格斯大学从事博士后研究。其过去十余年的技术路径主要围绕强化学习与智能体展开,涵盖以下阶段:
- 腾讯时期:担任智能体中心负责人,开展深度强化学习与机器人控制研究。曾利用深度强化学习和对抗博弈训练轮式机器人实现端到端主动目标跟随;研发《星际争霸》AI智能体TStarBots/TStarBotX,在多智能体强化学习(MARL)复杂博弈环境中取得重要成果。
- 字节跳动时期:
- 大规模RL系统:主导开发核心强化学习基础设施ByteRL,支撑多款自研游戏AI的高效训练。团队曾夺得IEEE CoG 2023策略卡牌AI竞赛冠军,研发的《炉石传说》AI具备击败行业顶尖选手的水平。
- 大模型后训练:参与LLM后训练研究,发布强化微调方法ReFT(Reinforced Fine-Tuning)及数学推理智能体DeltaProver;在Seed团队深度参与模型RLHF与预训练,在模型对齐、推理增强及Agent方向积累了前沿经验。
对星尘智能的战略意义
星尘智能坚持“Design for AI”理念,构建覆盖基座模型、商用模型、前端共生Agent、强化学习后训练的完整闭环。孙鹏的加入将夯实机器人模型“训练之后”的关键环节,具体协同效应如下:
- 技术协同:孙鹏在机器人强化学习、大规模RL系统及大模型RLHF/强化微调方面的积累,将与星尘智能现有的AI模型、具身OS(Operating System)和绳驱机器人本体形成协同。
- 产品体系完善:
- 基座模型Lumo系列:Lumo-1理解动作背后的逻辑,Lumo-2作为首个家庭隐式世界动作模型,引入Latent World Dynamics预测未来世界再生成动作。
- 前端Agent Philia:面向长期记忆、任务管理、多机器人协同与自然交互。
- 强化学习环节:承担机器人从真实环境交互与任务反馈中学习、优化行为策略的核心职能。
- 未来方向:孙鹏将参与星尘具身模型、机器人强化学习及后训练体系建设,探索如何将大模型时代验证的强化学习后训练方法与真实机器人执行、数据闭环及长期部署相结合,使机器人能够在一次次真实执行中越做越好。
