港科大谭平:几何与学习的互补,3D视觉从局部先验走向全局一致

2026/09/17 11:20阅读量 1

香港科技大学谭平教授在ECCV 2026提出,大规模视觉模型虽具备强大的局部生成与重建先验,但在跨视角和长距离场景中缺乏全局一致性约束。通过引入显式3D几何结构、关键帧机制及集束调整(BA)等经典优化方法,可有效解决误差累积与结构扭曲问题。该研究展示了“学习先验+几何约束”框架在提升3D重建精度与场景漫游稳定性方面的显著优势。

事件概述

在生成式AI快速发展的背景下,基于Transformer的大规模视觉模型(如VGGSfM、DUSt3R等)在单帧图像处理和局部3D重建中展现了极强的能力。然而,当任务延伸至多视角、长距离的3D世界构建时,仅依赖数据驱动的局部先验往往导致跨视角结构不一致、物体布局不合理或相机轨迹扭曲等问题。香港科技大学谭平教授指出,解决这一瓶颈的关键在于将深度学习提供的强大局部先验与经典3D几何的全局约束相结合,实现从“局部预测”到“全局一致”的跨越。

核心信息

1. 大规模SfM方法:缓解Transformer显存瓶颈

传统前馈网络在处理海量图像时面临严重的GPU内存限制(通常难以单次处理超过100张图像)。团队借鉴视觉SLAM中“建图与追踪分离”的思想,提出了基于**神经场景表示(Neural Scene Representation)**的大规模SfM方案:

  • 锚点帧构建:从输入图像中均匀采样关键帧(锚点帧),利用前馈网络获取初始3D结构。
  • Token采样与聚合:打破每帧保留固定Token的限制,随机保留20%-50%的Token,并将所有关键帧的Token聚合成一个轻量级的全局“场景表示”。
  • 非关键帧定位:对于其余海量非关键帧,仅需通过与该全局场景表示进行帧间注意力交互,即可直接估计相机位姿、深度图和点云。
  • 效果验证:该方法显著降低了显存开销,能够处理更大规模的图像输入。在Tanks and Temples数据集测试中,约70%的场景相对旋转和平移误差控制在5度以内;在新视角渲染质量(PSNR)上优于以COLMAP位姿训练的结果。

2. Global 3R:前馈鲁棒性与全局几何优化的融合

为了解决单纯前馈预测中的误差累积和尺度不一致问题,团队提出Global 3R框架,融合前馈网络的效率与传统全局SfM的精度:

  • 滑动窗口匹配:提取滑动窗口,在前馈网络内计算图像对间的相对运动和点云。
  • 关键帧选择与特征对齐:在窗口内选择关键帧,计算其与窗口内其他帧的匹配,获取一致的特征轨迹。
  • 全局优化:构建位姿图,执行旋转平均、平移平均及集束调整(Bundle Adjustment, BA)
  • 精度提升:实验显示,集束调整对3D点云质量提升显著。在ETH3D数据集上,经BA优化后,1度阈值下的旋转精度达到100%;相对平移误差精度从运动平均后的约35%翻倍至70%以上。新视角合成结果在细节还原上也超越了COLMAP及其他先进前馈基线。

3. 3D场景生成:显式几何约束增强空间一致性

针对扩散模型在生成复杂3D场景时出现的家具数量错误、布局不合理等问题,研究引入了显式3D布局作为结构约束:

  • ControlRoom(两阶段生成):受Text2Room启发,解耦为“布局生成”和“外观生成”。第一阶段训练扩散模型根据文本生成包含边界框和语义的3D房间布局;第二阶段利用ControlNet引导高保真全景图生成。引入随机循环平移以增强全景图左右边界的衔接一致性。
  • SpatialGen(大规模数据集与多模态生成):发布包含1.2万个场景、5.7万个房间的SpatialGen数据集,提供RGB、语义、深度等多模态渲染图像。提出布局引导的多视角扩散模型,联合生成RGB、语义及编码3D绝对几何信息的场景坐标图,并通过迭代融合至3D高斯模型,支持风格迁移与自由视角生成。
  • SpatialCraft(单图推断3D代理):面向用户仅提供单张图片的场景,采用两阶段策略。第一阶段从单图推断粗略的3D空间基底(体素化并补全不可见区域),保持像素对齐以保留原始特征;第二阶段引入视频扩散模型对基础漫游视频进行纹理细化。该方法在室外自然场景及长距离相机移动中仍能保持较好的空间一致性。

值得关注

谭平教授强调,3D几何并非要与学习方法对立,而是作为连接“重建”与“生成”的脚手架(Scaffold)。学习模型擅长从数据中提取局部先验,而经典几何方法(如多视图几何、全局优化)则为跨视角和长距离场景提供必要的结构约束。这种“学习先验 + 几何约束”的互补范式,对于推动空间计算、世界模型及具身智能的发展具有重要意义。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。