NeoteAI与复旦联合发布N0系列:3万小时触觉数据补齐机器人‘手感’,推动具身智能视触融合

2026/07/26 13:30阅读量 2

NeoteAI联合复旦大学发布N0系列三份技术报告,构建包含3万小时视觉-触觉交互数据的NeoData数据集,并提出NeoForce统一表征。在此基础上,N0-VTLA模型通过触觉预判(预测未来50步触觉演变)将插插头、拔钥匙任务成功率提升至85%和99%,远超纯视觉方案;N0-TWAM世界模型融合触觉预测,仿真成功率84.5%。项目数据和模型已开源。

事件概述

上海新智具身智能科技有限公司(NeoteAI)联合复旦大学可信具身智能研究院正式发布N0系列三份技术报告,旨在将触觉从“辅助模态”提升为具身智能的“核心基建”。项目数据和模型已开源(research.neoteai.com)。

N0-Foundation:构建3万小时触觉语料库

  • NeoData数据集:包含超3万小时视觉-触觉交互数据,约140万条操作片段,33亿个时间步,对应80亿帧RGB与100亿帧触觉图像。动用Franka、Piper、UR5e等6种机器人本体,由90位操作员采集450项真实长程任务(叠衣、插拔接头、倒液体等)。已开源5千小时数据。
  • NeoForce统一表征模型:实现跨传感器硬件(凝胶形变图、电容矩阵、六维力向量等)的触觉信号标准化,学习可迁移的时序结构化触觉表征,解决跨设备数据融合难题。

N0-VTLA:触觉预判增强VLA

  • 不依赖当前触觉,而是预测未来50步内的触觉演变(如滑移、受力趋势),结合视觉上下文调整动作。
  • 性能对比:
    • 插插头任务:N0-VTLA成功率85%,纯视觉方案60%;
    • 拔钥匙任务:N0-VTLA成功率99%,纯视觉方案35%。
  • 突破传统模仿学习局限:结合触觉信息与部署后数据训练进度评估模型,识别任务阶段(如“退步”“救场”),结合离线强化学习,使毛巾折叠(50%→95%)、书包收纳(35%→80%)、纸箱折叠(20%→75%)等长程任务成功率大幅提升。

N0-TWAM:触觉世界模型

  • 采用混合专家架构(视频、触觉、动作三个异步专家网络),总参数72亿,同时预测未来视频、触觉和动作序列。
  • 仿真平均成功率84.5%(世界模型最强基线为36%);真机8项任务平均成功率46.3%(LingBot-VA为21.9%)。消融实验证实,去除未来触觉预测或当前触觉条件均导致性能显著下降。

行业意义

  • N0-Foundation验证触觉具备类似视觉的Scaling潜力;N0-VTLA证明触觉可自然接入VLA架构;N0-TWAM确立触觉在世界模型顶层设计中的核心地位。机器人的认知范式正从“视觉驱动”向“视触融合”演进。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。