极佳视界王啸峰:数据和评测才是具身智能当前最大瓶颈,模型架构并非核心难题
2026/07/23 18:52阅读量 2
极佳视界算法合伙人王啸峰在接受采访时指出,具身智能(机器人)领域的模型架构仍在演进,但现阶段更大的卡点在于高质量数据的获取和标准化评测体系的缺失。极佳视界发布采用世界-动作模型(WAM)路线的GigaWorld-Policy-0.5,并自研机器人本体以获取真实场景数据。他认为家庭机器人真正可用的前提是达到1000万小时高质量数据和健全的benchmark,而商业化仍需模型能力提升后才可大规模铺开。
事件概述
在2026世界人工智能大会现场,极佳视界算法合伙人王啸峰接受访谈,围绕具身智能(机器人)当前的技术瓶颈、模型路线选择、数据策略、评测体系建设以及商业化路径等发表了观点。他强调,模型架构虽然重要,但当前行业的真正瓶颈在于高质量数据和标准化的评测体系(Benchmark)。
核心信息
-
模型路线:世界-动作模型(WAM)不是VLA的替代品
- 极佳视界新发布的GigaWorld-Policy-0.5采用WAM路线,将视频与动作作为两个“专家”分别训练,以提高数据利用效率。未来当动作数据足够时,模型可能回归统一形态。
- WAM与VLA(视觉-语言-动作模型)并非对立:高层任务规划依赖语言模型,而精细操作和物理交互由WAM负责,两者可协同工作。
-
数据是核心瓶颈
- 具身数据可分层:底层是互联网视频和世界模型生成数据,上层是仿真数据、本体采集的真实交互数据(rollout)。第一人称的Ego数据未来价值更大,因采集成本可控且扩展快。
- 王啸峰判断,1000万小时高质量真实交互数据可能足够支撑家庭机器人通用化,但高质量要求场景多样、标注准确、包含失败样本和动作细节。当前数据远未达标。
- 模型基础设施(如语言模型底盘)已较成熟,数据与评测才是关键短板。
-
评测体系亟需标准化
- 当前成功率评测无法精细定位失败原因,且不同团队任务定义各异,导致结果不可比。行业需要低成本、可复用的标准化benchmark。
- 极佳视界内部将benchmark团队与算法研发分离,用自动化方法构造任务矩阵并逐步骤打分,减少人工波动。同时先用世界模型和仿真做前置测试,再上真机,以降低试错成本。
-
自研本体的目的:获取真实数据并闭环迭代
- 极佳视界自研机器人本体Maker H01,名称寓意“make everything”。当前已在工厂中执行物体搬运、上下料和精细装配等任务。
- 自研本体的核心价值在于将模型置于真实场景中,收集实验室无法获得的失败数据、用户反馈和交互信息,形成“模型-本体-场景”的相互校正闭环。
- 已有超100台Maker H01完成下线和交付,公司2026年目标为千台交付,但最终取决于产品稳定性与客户验收。
-
家庭场景落地路径
- 先从人才公寓(武汉光谷之寓)切入,相比普通家庭更标准化,但仍具备真实环境复杂性。机器人目前已可完成清洗衣物、折叠衣物、简单烹饪(如番茄炒蛋)等长程任务。
- 王啸峰认为家庭机器人真正可卖的标准是:消费者愿意买回家,它能持续解决部分家务,且随使用逐步优化。目前模型仍需算法人员针对性微调,标准化产品化尚未成熟。
- 未来1-2年重点在于提升模型基础能力(类似于语言模型的泛化程度),之后再大规模进入垂直场景。
值得关注
- 王啸峰明确反对“模型路线决定论”,认为行业应优先解决数据质量和评测标准化问题。
- WAM路线代表一种不依赖强语言能力的物理交互方案,可能对精细操作场景更具优势。
- 自研本体+真实场景数据闭环的思路,与纯仿真或远程操作采集路径形成差异。
- 家庭机器人商业化的前提是模型能力再上一个台阶,而非仅靠Demo或特定场景交付。
