诺因发布GLOW技术报告:实现机器人“一教就会”,多项具身智能评测夺冠
9月24日,诺因(Knowin)发布面向通用具身智能的生成式学习架构GLOW技术报告,核心突破在于通过一次人类演示实现机器人跨场景、跨物体的任务复用。该架构由KnowinGLOW、KnowinDream、KnowinWorld和KnowinAgent四大模块协同,统一了认知与行动能力。实测数据显示,GLOW在RoboDojo、LIBERO-Pro及Embodied Arena等国际主流评测中均取得第一或领先成绩,显著优于GPT-6等基线模型。
事件概述
9月24日,诺因(Knowin)发布了面向通用具身智能的生成式学习架构 GLOW 技术报告。该架构旨在解决传统机器人学习新任务需重新采集数据、编写固定流程或针对性训练的痛点,提出了一条将通用认知能力转化为可靠物理行动的可行路径,核心目标是实现机器人“一教就会”的任务学习能力。
核心信息
1. “一教就会”的任务泛化能力
GLOW 改变了机器人学习新任务的方式,将人类的一次完整操作、当前环境、机器人自身状态与执行历史置于同一条链路中进行理解。其优势体现在以下具体场景中:
- 开盒收纳:即使更换不同的盒子或物品,机器人也能根据实时画面定位并调整姿态,无需重新教学即可完成全套动作。
- 浇水任务:当人类使用黑色细嘴壶教学,而实际执行时换成绿色浇水壶,机器人能自主映射抓握方式、对准角度等逻辑,动态调整动作姿态。
- 个性化擦桌:机器人不仅能学会“擦桌子”,还能捕捉用户特定的操作轨迹(如心形擦拭),复现个性化的操作特征。
- 复杂调酒:在多杯多步骤场景中,机器人能从人类操作中识别对象、倾倒关系和顺序,结合现场画面自主匹配酒杯,保证流程连贯。
2. 四大模块协同的技术架构
GLOW 通过将原有的 Brain 与 Act 能力统一到多模态自回归模型 KnowinGLOW 中,形成了从经验学习、任务理解到行动反馈的完整链路:
- KnowinGLOW(核心大脑):采用原生统一的自回归设计,整合视觉理解、语义解析、空间推理、任务规划与动作生成。理解与动作共享同一套表征体系,确保信息无损耗衔接。
- KnowinDream(合成经验引擎):以 Home×Event×Future 组织训练条件,记录世界状态、行动过程与物理后果。通过改变光照、材质、背景等变量,让机器人在训练阶段接触多样化的世界变化。
- KnowinWorld(世界推演单元):基于当前状态推演不同候选动作的物理约束(如碰撞风险、接触稳定性),在训练阶段替代真机试错以降低成本,在运行阶段预判风险以提升安全性。
- KnowinAgent/Harness(任务运行系统):负责全程管理任务进度与反馈。支持就地修正偏差,无需从头重启;在精细操作区域自动切换微调模式,保障长程任务的稳定精准。
3. 性能实测与评测结果
报告披露了 GLOW 在 RoboDojo、LIBERO-Pro 及 Embodied Arena 等评测中的表现,结果显示其在空间理解、物理交互与任务执行方面具有显著优势:
- RoboDojo 仿真任务:平均成功率 62.2%,平均得分 71.1 分,较 GPT-6 (Robocurve) 基线分别高出 40 个百分点和 41.3 分,位列第一。
- LIBERO-Pro 基准:独立运行的平均成功率达到 86.7%,较 GPT-6 Astra 的 58.2% 提升 28.5 个百分点。在六个扰动分项中五项领先,位列单策略模型第一,领先第二名 ASPIRE 15 个百分点。
- Embodied Arena 具身问答榜:KnowinBrain-1.5 以 65.62 的综合得分位列全球第一,覆盖第一视角理解、时空定位、目标驱动规划、物理推理等多个维度。
值得关注
诺因强调,具身智能的竞争核心正转向数据与学习方式。GLOW 路线主张以规模化物理经验训练模型,以统一架构协同认知与行动,并通过闭环执行适应环境变化。这种从“看过”走向“学会”的转变,意味着机器人学习的不再是单纯的手臂运动轨迹,而是任务目标、物体关系及环境变化后的应对策略。
