返回文章列表
视觉与视频

高德开源ABot-Recon:只看12帧,流式重建万帧3D场景

阅读约 2 分钟

导语

高德发布了流式3D重建模型ABot-Recon,目标是在移动拍摄过程中持续恢复三维场景。与需要回看大量历史帧的方案不同,ABot-Recon只使用最近连续12帧作为局部上下文,试图让重建系统在视频变长后仍保持相对稳定的计算开销。

核心要点

  • 不依赖长程记忆。 模型不设置不断扩张的全局记忆锚点,而是在当前相机坐标系中预测局部点云,并估计相邻帧之间的相对位姿。
  • 固定窗口在线拼接。 每次预测的结果通过在线组合接入全局轨迹,形成持续更新的三维场景,适合“边拍边建”的流式任务。
  • 针对误差累积进行纠偏。 官方介绍,ABot-Recon在预测和训练环节加入误差约束与实时校准机制,用于缓解局部估计不断叠加带来的轨迹漂移。
  • 单目输入、门槛较低。 系统只需单目RGB视频,不要求额外深度传感器或已知相机参数;官方披露峰值显存约为6.71GB,并称消费级GTX 1080Ti即可运行。

指标怎么看

在Oxford Spires长序列测试中,官方称ABot-Recon的平均轨迹误差较LingBot-Map低40.6%,相对旋转误差RPE-R为0.12°。在KITTI-02测试中,其推理速度为24.45 FPS,约为对比方法的1.24倍;峰值显存约6.71GB,约为同类模型的三分之一。上述结果来自项目方披露,实际表现仍可能受到硬件、输入视频和评测设置影响。

意义与影响

流式3D重建的关键矛盾在于:系统需要利用历史信息维持全局一致性,但历史越长,检索、融合和存储成本通常越高。ABot-Recon的思路并非让模型记住更多,而是把长期问题拆成连续的局部估计,再用纠偏机制维持整体轨迹。这种设计有望降低长视频重建对显存和计算资源的依赖,也更贴近仓库、园区、商场等定位信号不足且环境持续变化的场景。

从应用角度看,单目RGB输入意味着部署所需传感器更少,潜在用途包括私域地图更新、具身智能环境感知、自动驾驶辅助建图和三维内容生产。不过,局部预测路线仍需面对遮挡、快速运动、纹理缺失以及长期闭环一致性等问题,不能仅凭公开指标推断其在所有真实环境中都具备同等效果。

ABot-Recon已在GitHub开放推理与评测代码及模型权重,并在魔搭社区提供体验入口。对于开发者而言,开源资源有助于复现实验和进一步检验其在不同设备、视频长度与场景条件下的表现。

来源:量子位

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
SparsePR:用“分区+残差重建”加速视频生成注意力
视觉与视频
cctest.ai
视觉与视频

SparsePR:用“分区+残差重建”加速视频生成注意力

SparsePR提出一种无需再训练的稀疏注意力方案,通过响应耦合分区和探针拟合残差重建,降低视频Transformer的注意力计算成本。在四个视频生成与世界模型上,该方法以22.0%至26.0%的实际执行密度实现质量保持,并取得1.48至2.61倍端到端加速。

阅读全文