触觉补上世界模型“摸不透”短板,但“方言”问题仍拖累通用化

2026/08/21 00:34阅读量 3

加入触觉后,纯视觉世界模型在物体恒存性理解上提升33%,零样本任务成功率最高提升35%;但触觉传感器方案不统一,数据难以跨设备迁移,模型易被绑定在特定硬件上。企业正从传感器竞争转向数据与模型全链条布局,而长期仍需通用基础设施。

事件概述

在WRC 2026上,触觉赛道出现明显变化:玩家不再只讲传感器硬件能力,而是开始展示数据集、模型和评测基准。围绕触觉的竞争,正从单块传感器扩展到数据采集、模型训练和能力评估的整条链路。

核心矛盾在于:触觉能补上纯视觉世界模型“看得见、摸不透”的短板,但同一次接触换一个传感器或灵巧手,反馈信号可能完全不同。这既让模型更懂物理,也让模型更容易被焊死在某一套硬件上。

核心信息

触觉显著提升世界模型物理理解能力

  • 华盛顿大学与Meta FAIR团队的《Visuo-Tactile World Models》论文显示,加入触觉后,模型在物体被遮挡时的物体恒存性理解提升33%,符合运动规律比例提升29%,真实机器人零样本任务成功率最高提升35%。
  • 新智具身与复旦团队发布的N₀-TWAM模型,在UniVTAC仿真基准上平均成功率达84.5%,远超纯视觉世界动作模型FastWAM的48.0%。

触觉硬件不统一造成“数据方言”困境

  • 电容、压阻、霍尔磁、视触觉等路线记录的不是同一种信号:有的输出压力数值,有的测量不同方向力,有的记录接触面形变图像。
  • 模型可能学到的是“这套传感器在打滑时电压如何跳”,而非可迁移的物理规律;换传感器后“手感”需从头学起。领域缺少类似摄像头的标准化硬件底座。

跨传感器迁移已有初步方案

  • 清华、UC Berkeley与Sharpa等8家机构联合提出的FTP-1,聚合26个数据源、21种传感器和约3000小时触觉操作数据预训练,通过统一触觉表示空间处理不同传感器输入。
  • 在未见过的两套传感器配置和三项任务上,FTP-1平均成功率为46.6%,高于基线模型15.0%。但接入新传感器仍需从头训练编码器,且每项任务各需50-100条示范数据,尚未实现零样本迁移。

企业从传感器竞争转向数据与模型全链条

  • 千觉机器人7月发布数采夹爪、千小时视触觉数据集TacVerse 1k和触觉模型X-TouchMind V1,形成采集-数据-模型闭环。
  • 戴盟机器人发布含触觉的全模态数据集Daimon-Infinity,首批1万小时数据已开源,并与银河通用发布触觉操作评测基准RobOmni。
  • 他山科技在触觉传感器月交付量达数万枚的同时,开始建设触觉训练平台,并提出研发“触觉原生模型”。

研究界同样将触觉拉回核心设计环节

  • RSS 2026触觉专题研讨会上,研究者认为触觉正被重新纳入机器人基础模型的核心设计。
  • OmniVTA、TouchWorld等模型均把触觉纳入“预测接下来会发生什么”的世界模型任务范畴。

值得关注

  • 斯坦福、伯克利与英伟达的T-Rex论文给出反例:将触觉信号直接拼接进已训练好的VLA模型,平均成功率从17%降至6%;采用独立高频触觉专家和专门训练流程后才提高到65%。触觉与视觉的频率差异、同步方式和表示方法仍是重大挑战。
  • 短期看,能建立自家可用体系的“全栈派”企业更易落地,因为客户需要能跑通的方案;长期看,被锁死在自有硬件出货量天花板内的公司难有大估值,真正有潜力的是做出“触觉界ImageNet或Transformer”的通用基础设施提供者。
  • 触觉真正进入通用世界模型的标志,不是模型能生成一段逼真的触觉信号,而是模型不必跟着每一款传感器重新认识一次物理世界。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。