RSS 2026现场直击:机器人操作迈入“少样本时代”

2026/08/19 14:12阅读量 3

2026年机器人顶会RSS于悉尼开幕,主会仅接收约160篇论文。本届会议多篇研究聚焦少样本操作,通过人类视频学习、触觉对齐、仿真转真实等路径,显著降低数据依赖,覆盖双臂协同、手术辅助与水下灵巧操作等场景。

事件概述

2026年机器人领域顶级学术会议RSS(Robotics: Science and Systems)于7月13日在悉尼开幕,主会仅接收约160篇论文。在“Manipulation 1: World Models & Memory”论文报告环节,来自全球顶尖实验室的研究者展示了机器人操作领域的最新突破。共同趋势是:机器人正摆脱对海量标注数据的依赖,迈向“少样本、强泛化”的新阶段。

核心研究方向与论文

一、向人类“借”数据,突破数据匮乏

  • BiDemoSyn(华南理工大学):将双臂操作拆解为“不变协调块”与“可变物体适应”,仅需一段真实示范视频,即可在数小时内合成数千条物理可行的训练数据;在六个双臂任务中实现对新物体位姿和形状的鲁棒泛化,并支持零样本跨本体迁移。
  • DexImit(上海人工智能实验室、清华大学):提出四阶段自动化管线,从任意视角的人类操作视频中重建手-物交互、分解子任务并合成机器人轨迹,可零样本部署到真实世界,大幅降低灵巧手训练数据的采集门槛。
  • TactAlign(UC Berkeley、Meta):利用整流流将人类与机器人的触觉观测映射到共享潜在空间,无需配对数据或人工标注。在拧灯泡等接触密集型任务中,仅需不到5分钟人类触觉数据即可实现零样本迁移。

二、跨越虚实与场景鸿沟

  • 监督式混合专家(MoE)手术操作(德国国家肿瘤疾病中心):仅以立体内窥镜图像为输入,叠加监督式MoE的轻量级ACT模型在不到150条演示数据下学会肠道抓取与牵拉,并在离体猪组织上零样本泛化,完成体内猪手术初步验证。
  • Semantic-Contact Fields(SCFields)(新加坡A*STAR、NUS):融合视觉语义与密集接触估计,两阶段Sim-to-Real管线先在仿真中预训练接触先验,再用少量真实数据微调,实现对未见工具实例的类别级泛化。
  • UMI-Underwater(斯坦福大学、哥伦比亚大学):利用深度图在不同光照和水质下的稳定性,在陆地手持演示上训练模型,通过几何对齐零样本部署到水下;配合自监督数据采集,水下抓取性能全面超越纯RGB方法,并能泛化到未在陆地数据中出现过的物体。

三、重塑模型底层逻辑

  • 视觉-语言-动作(VLA)模型共训练数据研究(Meta AI):利用4000小时操作数据和5000万视觉-语言样本训练了89个VLA策略,进行超6万次测试。结果显示,视觉-语言数据与跨本体机器人数据联合共训练效果最佳,可显著提升对分布偏移和未见任务的泛化;仅用机器人数据训练会退化视觉语言理解,离散动作token收益甚微。
  • SID(浙江大学):以物体为中心的运动场在推理时将偏离轨迹的机器人“拉回”安全区,配合轻量级执行策略完成精细操作。在仅两次演示的条件下,六个真实世界任务在分布外初始状态下仍保持约90%成功率。
  • Contact-Grounded Policy(CGP)(UCSD、Brown、Sony AI):视觉-触觉联合策略框架,通过条件扩散模型预测状态-触觉耦合轨迹,并利用学习到的接触一致性映射将预测转化为柔顺控制器可执行的目标状态,在多点触觉机械手上操控、抓取和工具使用任务均优于现有基线。

值得关注

这些研究从数据来源、场景迁移和模型机制三个层面共同推动机器人操作走向“样本高效”。未来,机器人无需再依赖实验室中反复采集的千万级演示数据,而可以更多地从人类经验、仿真环境和物理交互中直接学习。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。