乐聚发布KUAVO VLA垂域具身模型:中训练策略实现工业场景高效落地
2026/08/27 15:52阅读量 3
乐聚机器人推出面向工业场景的垂域具身智能模型KUAVO VLA,通过在通用VLA基础模型上进行600+小时同构型真机数据的“中训练”,沉淀本体适配与工业共性能力。该模型在包含25项任务的Benchmark中,以48.27%的任务成功率和74.51%的过程分位列第一,显著优于Lingbot-VLA 2.0等基模。这一方案旨在解决后训练成本高、数据重复采集等痛点,为二次开发者提供更低门槛、更高效率的工业落地路径。
事件概述
乐聚机器人发布了专为工业场景构建的垂域具身智能模型——KUAVO VLA。该模型并非从零开始训练,而是以通用视觉-语言-动作(VLA)基础模型为起点,引入了一种被称为“中训练”(Mid-train)的策略。通过利用600多个小时的KUAVO同构型真机数据进行针对性训练,将本体适配、基础操作及工业场景的共性能力内化到模型中,从而填补了通用基模与实际执行技能之间的鸿沟。
核心技术与优势
- 中训练策略:区别于传统的预训练和后训练,中训练在两者之间插入了一层针对特定领域的训练。它将通用的“通识课”转化为工业领域的“专业课”,使模型在具备基础智能的同时,快速掌握分拣、搬运、上下料、装配等100个“原子动作”。
- 同构型数据聚焦:与跨本体混合训练不同,KUAVO VLA仅使用单一构型的真机数据。这种集中式学习减少了不同本体间的差异干扰,使模型能深度绑定本体特性,显著降低推理误差和执行抖动,提升动作平滑性与决策稳定性。
- 降本增效:
- 减少数据成本:无需采集海量开放世界数据,只需聚焦工位、物料和工艺流程,大幅降低数据采集、清洗和标注开销。
- 缩短开发周期:新任务开发从“重新学习”转变为“快速适配”,开发者可将资源集中在关键差异优化上,避免重复的数据采集和调试工作。
- 实际提效:在部分场景中可实现约一倍的效率提升,某些任务成功率可达100%。
Benchmark表现
在包含25项任务(20项定制化工业任务 + 5项公共GM100任务)的评估体系中,KUAVO VLA的表现如下:
- 综合排名:任务成功率 48.27%,过程分 74.51%,两项指标均位列第一。
- 对比基模:相较于通用基模 Lingbot-VLA 2.0(成功率16.27%,过程分42.06%),KUAVO VLA的成功率提升了32%,过程分提升了32.45%。
- 执行质量:在多步操作、连续抓放及狭小工位约束下,表现出更少的动作抖动、重复修正和决策迟滞。
生态与开发者支持
乐聚机器人强调对二次开发者的支持,认为“能让开发者赚到钱的平台才是好平台”。针对后训练耗时耗力、技能无法迁移等行业痛点,KUAVO VLA提供了更友好的二次开发环境:
- 工具链与服务:提供端到端的工具链、培训及专门的服务团队,直接解决开发者在实际场景中的问题。
- 降低门槛:通过预置的垂域能力,降低了技能开发的资金和时间门槛,使前沿开发工作从劳动密集型转向更高效的技术优化型。
- 开放兼容:不绑定特定基础模型,允许开发者在不同模型间迁移,享受性能提升的同时保持灵活性。
行业意义
KUAVO VLA的推出标志着具身智能落地范式的一种探索。通过将工业Know-how沉淀为模型能力,乐聚试图解决通用大模型在垂直领域“水土不服”的问题。随着更多开发者体验到该方案在效率和成本上的优势,垂域具身模型有望成为工业落地的主流技术路径之一。
