高德发布ABot-Recon:摒弃长程记忆,以12帧局部窗口实现万帧级流式3D重建
8月28日,高德发布首个无长程依赖的万帧级流式3D重建模型ABot-Recon。该模型仅凭连续12帧局部画面即可实时重建上万帧3D场景,通过“局部位姿预测+残差优化”路径解决传统方法中的误差累积与显存瓶颈问题。在KITTI、Oxford Spires等基准测试中,其轨迹误差较行业代表方法降低40.6%,峰值显存占用仅约6.71GB,支持消费级显卡运行。
事件概述
8月28日,阿里巴巴集团旗下高德正式发布首个无长程依赖的万帧级流式3D重建模型 ABot-Recon。该模型突破了传统流式3D重建对长程记忆的依赖,仅需连续12帧局部画面,即可实时稳定重建包含上万帧数据的3D场景,实现“边拍边建”。在KITTI、Oxford Spires、VBR等权威评测中,ABot-Recon均取得了最低误差的SOTA(State of the Art)表现。
核心技术与创新
针对自动驾驶、具身智能等在开放环境中对空间持续理解的需求,传统流式3D重建技术常因设置记忆锚点来保持全局一致性,导致随着序列变长,出现速度慢、精度下降及显存激增等问题。
ABot-Recon采用了全新的技术路径——“局部位姿预测+残差优化”:
- 摒弃长程记忆:模型不依赖历史锚点进行记忆对齐,而是以最近的12帧连续画面作为局部上下文窗口。
- 恒定计算复杂度:每次仅预测当前相机坐标系下的局部点云和相邻两帧之间的相对位姿。由于预测目标始终与序列长度无关,模型的内存占用和单帧计算量不再随视频时长膨胀。
- 在线组合与纠偏:通过在线组合逐步拼出完整的全局轨迹与三维场景,并在预测和训练端分别设计纠偏和误差约束机制,实时校准轨迹误差,有效应对局部预测中的误差累积问题。
关键性能指标
ABot-Recon凭借上述设计,在精度、速度和资源消耗上实现了显著突破:
- 精度提升:在Oxford Spires长序列基准测试中,平均轨迹误差较行业代表方法LingBot-Map降低 40.6%;相对旋转误差RPE-R低至 0.12°,为同类流式方法最优,较前代SOTA降低约40%。
- 速度优势:在KITTI-02测试中,实现 24.45 FPS 的实时重建,推理速度达到行业代表方法的1.24倍。在平均轨迹误差低于20米的方法中,ABot-ReCon拥有最高的吞吐量和最低的显存占用。
- 低显存需求:峰值显存占用仅约 6.71GB,约为同类模型的三分之一。这意味着使用如GTX 1080Ti这样的消费级显卡即可运行,大幅降低了流式3D重建的使用门槛。
应用场景与开源情况
-
输入要求低:仅需单目RGB视频输入,无需额外深度传感器或已知相机参数。
-
应用广泛:适用于测绘行业的私域建图与底图更新,以及具身智能、自动驾驶和3D内容生产等场景。
-
开源信息:目前,ABot-ReCon已在GitHub开源了推理及评测代码和权重,并在魔搭社区上线了体验专区。
-
技术报告:https://github.com/amap-cvlab/ABot-Recon/blob/main/ABot-Recon-Tech-Report.pdf
