RSS 2026:港科大(广州)开源FreeOcc,首个无需训练的开放词汇3D占据预测系统
香港科技大学(广州)联合MBZUAI提出FreeOcc,首个无需训练即可基于单目或RGB-D图像在线构建开放词汇3D占据地图的系统,被RSS 2026接收并开源。在EmbodiedOcc-ScanNet上,其单目版本IoU/mIoU达31.29/13.86,RGB-D版本达34.40/15.84,均超现有自监督方法两倍以上;在跨数据集基准ReplicaOcc上,RGB-D版本零样本泛化达55.65 IoU/20.90 mIoU。
事件概述
香港科技大学(广州)陈昶昊教授团队联合穆罕默德·本·扎耶德人工智能大学(MBZUAI)研究者提出 FreeOcc,这是首个无需训练(training-free)的开放词汇三维占据预测系统。该系统仅基于单目或 RGB-D 图像序列,即可在线构建全局一致的开放词汇三维占据地图。相关工作已被机器人领域旗舰会议 Robotics: Science and Systems(RSS 2026)接收,论文、代码和数据集均已开源。
核心方法
FreeOcc 将在线开放词汇占据预测拆解为四层模块化地图表示,并在机器人观测过程中持续联合更新:
- 点云地图:基于 SLAM 系统从图像序列中估计相机位姿并重建全局一致的半稠密点云。
- 3DGS 地图:以 SLAM 点云为几何锚点初始化并更新 3D 高斯,用连续场补充稀疏几何结构。
- 语义地图:利用预训练视觉语言模型提取开放词汇语义特征,并关联到高斯基元。
- 占据地图:通过概率式高斯至占据(Gaussian-to-Occupancy)投影,将带语义的高斯表达转换为稠密体素占据地图,支持任意文本查询。
针对现有 3DGS-SLAM 方法偏向渲染质量、几何一致性不足的问题,FreeOcc 提出几何感知初始化(G-ini) 与几何锚定高斯更新(GAGU),将高斯几何中心锚定在 SLAM 重建点上,并沿观测射线进行各向异性展开,从而保证体素级空间推理所需的长期几何一致性。
关键结果
-
EmbodiedOcc-ScanNet 基准:在完全不使用占据真值、语义标注和真实相机位姿的情况下,FreeOcc 单目输入达到 31.29 IoU / 13.86 mIoU,RGB-D 输入达到 34.40 IoU / 15.84 mIoU,相比现有自监督方法(GaussianOcc、GaussTR)在 IoU 与 mIoU 上均实现超过两倍提升。
-
ReplicaOcc 跨数据集零样本泛化:论文构建了基于 Replica 场景的细粒度语义基准 ReplicaOcc。从 EmbodiedOcc-ScanNet 迁移时,监督方法 EmbodiedOcc 的语义 mIoU 几乎降为 0,自监督方法也无法生成有效结果;FreeOcc 则保持稳定,单目输入达到 46.81 IoU / 16.93 mIoU,RGB-D 输入达到 55.65 IoU / 20.90 mIoU。
-
3DGS-SLAM 主干对比:在几何 IoU 上,FreeOcc 单目平均 IoU 为 39.34,RGB-D 平均 IoU 为 45.24,均优于 Photo-SLAM、MonoGS、DROID-Splat、SplaTAM、GS-ICP、RTG-SLAM 等方法。
-
消融实验:移除 GAGU 与 G-ini 后,RGB-D 设置下精度降至 27.98 IoU / 11.20 mIoU / 8.8 FPS;加入 GAGU 后提升到 40.18 IoU / 16.03 mIoU / 25.0 FPS;完整 FreeOcc 达到 45.03 IoU / 18.37 mIoU / 24.6 FPS,显示 GAGU 对效率和长期一致性的关键作用。
-
开放词汇查询:FreeOcc 能响应“篮子”“时钟”“室内绿植”“挂画”等任意文本查询并在三维地图中定位目标。在 ReplicaOcc 上,top-10 类别 mIoU 为 31.06,扩展至 top-40 时仍保持 12.01 mIoU。
值得关注
FreeOcc 通过将 SLAM 的全局一致性、3DGS 的稠密表达能力与开放词汇语义理解融合,绕开了传统端到端占据预测对三维真值标注的依赖,直接支持新场景零样本部署。其源代码、数据集及项目主页均已公开,为机器人具身感知提供了一条“无需训练”的可行路径。
