中山大学提出SpatialSV:通过内部3D几何重建打破大模型空间智能黑盒

2026/09/03 18:07阅读量 2

中山大学团队发布论文《SpatialSV》,提出一种将2D视觉特征在中间隐藏层直接提升为显式3D几何表达的方法,以增强多模态大模型的空间感知能力。该方法通过预测深度图、射线图和点云图构建三维物理拓扑,并在推理阶段卸载相关模块以实现零延迟。实验表明,3D重建精度与空间问答准确率高度正相关,且利用开源3D模型自动生成几何监督信号,可在仅保留50%文本标注的情况下,使模型性能接近全量标注水平。

事件概述

中山大学研究团队在论文《SpatialSV: Internalizing Interpretable 3D Spatial Awareness in MLLMs via Task-Oriented Visual Supervision》中,提出了一种名为 SpatialSV 的新框架。该框架旨在解决多模态大语言模型(MLLMs)在空间推理中的“黑盒”问题,通过让模型在训练阶段内部生成显式的3D几何表征,从而低成本地重塑真实空间智能。

核心机制:内部3D几何重建

传统赋予MLLMs 3D感知能力的方法通常依赖外部深度模型(增加延迟)或蒸馏隐特征(缺乏可解释性)。SpatialSV 的核心创新在于:

  1. 特征提取与映射:从大模型(如 Qwen2.5-VL)的中间隐藏层(第4、12、20、28层)提取特征,并映射到统一的三维特征空间。
  2. 解耦轻量化预测:引入 DPT 模块同步预测三项互为补充的显式几何表征:
    • 深度图:确定物体空间距离与前后层次,通过梯度 Loss 抑制边缘模糊。
    • 射线图:预测像素的射线起点与方向,隐式建模相机位姿,避免旋转矩阵优化的不稳定性。
    • 点云图:还原像素在三维世界的坐标,配合法向量 Loss 约束几何表面平整度。
  3. 推理零延迟:上述3D预测头与几何 Loss 仅在训练阶段参与优化。进入推理阶段后,所有2D-to-3D投影层被直接卸载,模型依靠内部形成的空间表征回答问题,无额外计算开销。

关键发现:3D重建质量决定空间智能上限

通过对 Qwen2.5-VL、InternVL3、LLaVA 系列等8个主流模型的探测分析,研究发现:

  • 强相关性:模型的3D重建误差(RMSE)与空间问答准确率呈极强负相关。重建越精准,回答越准确。
  • 可视化的“CT诊断”:生成的3D点云和深度图可作为诊断工具。例如,当模型回答错误时,可视化显示其内部并未建模出关键参照物(如“小桌子”),导致空间关系判断失效。这种“关键实体遗漏”或“空间锚点丢失”是模型答错的主要原因。
  • 预判能力:无需查看最终文本输出,仅通过观察3D渲染质量(如断裂、坍塌区域),即可预判模型在特定场景下的潜在失误。

数据效率突破:半监督学习降低标注成本

针对3D VQA数据集标注成本高、量产难的问题,SpatialSV 实现了几何监督与自然语言问答的解耦:

  • 自动化监督信号:调用开源3D视觉基础模型(如 DepthAnything-v3、VGGT),对海量无标注图像批量提取深度图、相机参数并转化为点云/射线图,作为几何监督信号。
  • 实验验证:在 Qwen2.5-VL-3B 上的对照实验显示:
    • 全量文本标注准确率:55.3%
    • 仅50%文本标注准确率:47.2%
    • 50%文本标注 + 自动生成的3D几何监督准确率:53.9%

加入自动几何监督后,性能相比纯文本基线提升了 14.19%,非常接近全量标注水平。

结论与意义

SpatialSV 证明了单纯依靠自回归文本预测难以让模型自发收敛出稳定的三维拓扑。通过引入经典计算机视觉任务(深度估计、点云重建)作为辅助任务,为大模型主干添加了刚性的“几何正则化约束”。这一范式不仅提升了模型的可解释性和推理效率,更为具身智能系统提供了一条兼顾高性能与低数据成本的高效训练路径。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。