WAIC圆桌实录:世界模型“六小龙”激辩技术路线,行业红利藏于非共识
2026/07/24 15:29阅读量 2
在WAIC 2026“世界模型六小龙”论坛上,六家头部公司的技术负责人就世界模型的技术路线、物理理解程度、长时推演的重要性、未来收敛方向以及从Demo到部署的挑战展开激烈讨论。嘉宾们分属像素生成、隐空间JEPA和融合派三大阵营,对“物理合理性”与“物理精度”、“长时一致性”与“推理时效性”等核心问题存在根本分歧。行业共识尚未形成,但评测标尺、触觉模态及融合架构被认为可能率先收敛。
事件概述
2026年7月19日,WAIC“世界模型六小龙”论坛举办了一场圆桌讨论,参与方包括大晓机器人首席科学家陶大程(主持人)、蚂蚁灵波首席科学家沈宇军、极佳视界联合创始人兼首席科学家朱政、无界动力联合创始人兼CTO夏中谱、智元机器人AI算法总监任广辉、自变量机器人联合创始人兼CTO王昊。六位嘉宾围绕世界模型的概念、技术路线、评价标准与落地挑战进行了深度交锋。
核心分歧:三大技术路线与两大争议点
技术路线分类
根据模型在什么空间推演世界,可分为三派:
- 像素生成派(代表:极佳视界):直接生成视频帧。
- 隐空间(JEPA)派(代表:无界动力):在抽象特征空间预测物理量。
- 融合派(代表:大晓机器人、蚂蚁灵波、自变量机器人、智元机器人):结合多种方法。
争议一:世界模型需要多深度的物理理解?
- 无界动力夏中谱主张评估模型对几何、运动、力的预测精度,要求接近物理模拟器。
- 蚂蚁灵波沈宇军则认为“物理合理性”比“物理精度”更重要,机器人只需明白“重物下坠更快”的定性关系,无需精确计算。他认为机器人不必成为物理学家。
争议二:长时一致性是否必要?
- 智元任广辉强调“长时物理一致性”是评价世界模型能力的关键指标。
- 自变量王昊则直言长程推演是“伪需求”,更看重推理的时效性,过慢的推理会错失决策窗口。分歧背后是各自模型用途不同:智元将世界模型用作仿真器(依赖长程推演),自变量则将世界模型与VLA整合进端到端框架(推理速度直接约束决策时间)。
未来收敛方向:四位嘉宾的预测
- 统一表征(任广辉、夏中谱):语言模型找到了token,具身智能尚未建立统一模态的token。
- 融合(王昊):视频生成贡献预测、隐空间贡献推理、3D显式建模提供空间记忆,类似大语言模型的发展史。
- 触觉(沈宇军):触觉数据一旦突破,物理世界与数字世界的世界模型将分道扬镳。蚂蚁灵波正在开发具身原生的自回归世界模型,从控制需求出发而非视频生成。
- 评测标尺(陶大程):横向的评测基准可能率先收敛,如同ImageNet统一了深度学习评价。大晓机器人在论坛发布了PHYSICAL IQ,定位为首个具身原生、面向多场景多本体的物理智能评测基准。
从Demo到Deployment:规模化部署的挑战
- 模型能力从90%到99%再到99.9%的成本呈指数级增长。实验中微小的错误率,在部署现场会导致频繁的人工接管与返工。
- 蚂蚁灵波沈宇军举例:机器人找蔬菜时,顾客可能把蔬菜放进牛奶柜,这类随机情况是日常挑战。
- 大晓机器人陶大程强调端侧能力:机器人留给自己做判断的时间仅几十到几百毫秒,网络不能永远在线。最难的不是让模型变聪明,而是让聪明变得便宜、可靠、及时。
两年后的回看:什么做对?什么做错?
- 沈宇军:为模型架构能力与数据链路所做的准备大概率正确;但过度追求生成效果等外在呈现可能走偏;当前积累的数据未来是否被用到尚不确定。
- 朱政:当前在基模未收敛时过早探索商业化场景,大概率不会成功。
- 任广辉:世界模型将走向“具身原生”,需要更大规模的具身原生数据与原生架构。
- 陶大程总结:分歧是论文的素材,重叠是产业的基底。对行业而言,非共识本身就是当前的机遇与红利。
