机器人行业转向“拼脑子”:具身大模型成竞争核心,数据成新护城河
2026年世界机器人大会显示,具身智能行业正从比拼硬件本体和运动控制,转向以具身大模型为核心的“大脑”竞争。上半年国内具身智能融资超430亿元,过半资金流向“大脑”方向;但数据缺口巨大,行业距“ChatGPT时刻”仍远。
事件概述
2026年8月19日至23日,世界机器人大会(WRC)在北京举行。展会上,人形机器人叠衣、洗衣、做饭、搭积木、搬箱子的场景明显增多,厂商宣传也频繁出现“具身大模型”“自主驱动”等词。智平方机器人做咖啡,深朴智能洗衣服,星尘智能做饭,银河通用和蚂蚁灵波在零售区忙碌,加速进化机器人还与人踢起点球。行业正在从展示身体能力转向比拼机器人的“大脑”。
核心信息
-
融资风向已变:一位创投行业人士表示,只做机器人本体已经拿不到融资,需要同时做“机器人大脑”;只做本体和运动控制,大概率难与宇树、智元等企业竞争。2023年国内具身项目以本体和小脑(运动控制)为主,2024年5月后专注本体的初创企业融资占比下降36.8%;据量子位统计,2026年上半年国内具身智能融资总额超430亿元,其中50.8%投向以“大脑”为主的公司,18.5%投向“大脑+本体”。
-
具身大模型是商业化必然:家庭和商业场景并不标准化,机器人需要理解任务、自主决策,并在出错时调整动作。只靠固定程序很难应对光线、空间和任务变化。开发具身大模型成为机器人从“能走能跳”走向“会干活”的关键门槛。
-
数据是当前竞争焦点:有开发者认为,具身大模型竞争本质上是数据竞争。行业期待数据量达到临界点后出现类似“ChatGPT时刻”的能力涌现。但现有数据远不够:有观点称,自动驾驶实现约需10亿条数据,具身智能要达到“ChatGPT时刻”保守估计需100亿条,而行业目前体量约100万条。数据采集方式包括真机遥操作、第一人称数据/便携UMI和仿真数据。真机遥操作成本太贵,仿真数据可靠性仍受质疑;第一人称数据被认为成本可控、可靠性高、泛化有保证,是业内主流。也有专家认为随着拟真数据可靠性提高,仿真数据未来可能成为主流。展会上的互动环节看似面向观众,实际也在为模型积累真实世界的视觉、动作和环境反馈。
-
大厂加速布局基座模型:蚂蚁灵波在2026年1月发布并开源空间感知模型、LingBot-VLA模型和LingBot-World模型,7月更新2.0版本;小米于2月发布并开源Xiaomi-Robotics-0,7月发布2.0版本;京东在4月发布JoyAI-RA具身大模型。部分中小机器人厂商已采用大厂基座模型。
-
技术路线尚未收敛:目前主流路线分为VLA(视觉-语言-动作)和世界模型(World Model)两类。VLA落地快、成本低,但泛化能力弱,正向“慢系统负责理解规划、快系统负责低层控制”演进;世界模型以李飞飞的Marble、Google的Genie为代表,强调先构建物理世界模型再规划动作,因果推理和泛化潜力更强,但算力消耗和反馈成本更高。展会上标榜自主驱动的厂商多采用世界模型路线。两者融合是趋势,但尚未形成统一共识。
值得关注
基座模型与运动控制目前仍处于分离状态,行业普遍认为两者要到“ChatGPT时刻”才会真正统一。数据正在成为新的护城河,但大厂优势并不绝对,谁能更快建立“采集—训练—部署—再采集”的闭环,谁才可能把数据转化为模型能力。距离真正的“开奖”仍有一段距离,市场预计还会经历多轮乐观与悲观的反复。
