Scal3R:用于可扩展在线三维重建的高效多相对姿态查询
摘要
Scal3R 通过使用带有轻量级令牌和位姿图优化的多参考相对姿态查询,改善了长视频的在线三维重建,减少了漂移并实现了最先进的性能。
查看缓存全文
缓存时间: 2026/09/04 11:57
论文页面 - Scal3R:学习高效的多相对位姿查询以实现可扩展的在线三维重建
来源:https://huggingface.co/papers/2609.04201
摘要
Scal3R 通过使用轻量级令牌查询多参考相对位姿并结合位姿图优化,改进了长视频在线三维重建,在不重新训练骨干网络的情况下减少了漂移。
在线三维重建 (https://huggingface.co/papers?q=Online%203D%20reconstruction) 模型在长视频上表现不佳。这是因为将位姿相对于固定的首帧锚点进行回归,会迫使模型进行远超训练分布的外推。微小的漂移会累积 (https://huggingface.co/papers?q=ate) 并放大,导致显著的几何崩溃。然而,我们观察到在此失败过程中,每帧的深度保持稳定。骨干网络的局部几何结构保持完好;只有全局位姿头失效。受此解耦现象 (https://huggingface.co/papers?q=ate) 的启发,我们引入了 Scal3R。该方法将在线重建重新表述为多参考相对位姿查询 (https://huggingface.co/papers?q=relative%20pose%20querying)。我们使用轻量级可学习令牌 (https://huggingface.co/papers?q=learnable%20tokens)(约占参数量的1%),并通过非对称注意力 (https://huggingface.co/papers?q=asymmetric%20attention) 将它们注入到一个完全冻结的骨干网络 (https://huggingface.co/papers?q=frozen%20backbone) 中。该设置查询相对于多个过去关键帧的位姿。一个带有回环检测 (https://huggingface.co/papers?q=loop%20closure) 的在线位姿图优化 (https://huggingface.co/papers?q=pose-graph%20optimization) 系统抑制了长程漂移。Scal3R 在单个 GPU 上 8 小时内即可收敛。与在线基线相比,它在 KITTI 数据集上将平均 ATE (https://huggingface.co/papers?q=ATE) 降低了 60% 以上。它在 Virtual KITTI、Sintel、TUM-Dynamic、ScanNet 和 7-Scenes 数据集上均达到了最先进的性能 (https://huggingface.co/papers?q=ate)。项目页面:https://linjohnss.github.io/scal3r/
查看 arXiv 页面 (https://arxiv.org/abs/2609.04201)查看 PDF (https://arxiv.org/pdf/2609.04201)项目页面 (https://linjohnss.github.io/scal3r/)添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2609.04201)
在您的智能体中获取此论文:
hf papers read 2609.04201
还没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
无模型关联此论文
在模型的 README.md 中引用 arxiv.org/abs/2609.04201 即可从本页面链接到该模型。
引用此论文的数据集0
无数据集关联此论文
在数据集的 README.md 中引用 arxiv.org/abs/2609.04201 即可从本页面链接到该数据集。
引用此论文的 Space0
无 Space 关联此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2609.04201 即可从本页面链接到该 Space。
包含此论文的收藏集0
无收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从本页面链接到它。
相似文章
Lite3R:一种高效的模型无关前馈3D重建框架
Lite3R 是一个模型无关框架,通过稀疏线性注意力和 FP8 感知量化,提升了基于 Transformer 的 3D 重建效率。在保持 VGGT 和 DA3-Large 等主干网络几何精度的同时,它将延迟和内存占用降低了高达 2.4 倍。
AnyRecon:基于视频扩散模型的任意视角 3D 重建
AnyRecon 提出了一种可扩展框架,利用具备持久场景记忆与几何感知条件的视频扩散模型,从任意稀疏输入进行 3D 重建。
GenRecon:结合生成先验的多视图3D场景重建
GenRecon提出了一种3D场景重建方法,将生成式3D先验与多视图图像条件相结合,实现了室内环境的高保真、可编辑网格重建,性能比现有方法提升16%。
TrackCraft3R: 改造视频扩散变换器用于密集3D追踪
TrackCraft3R 改造视频扩散变换器,用于从单目视频进行密集3D追踪。它采用双潜在表示和时间RoPE对齐,以比先前方法快1.3倍的速度和少4.6倍的峰值内存,实现了最先进的性能。
从低重叠拍摄进行4D人体-场景重建
提出StudioRecon,一种从低重叠相机拍摄中进行4D人体-场景重建的方法,使用背景(视频扩散)和人体(SMPL)的独立先验,并带有递归增强模块。已被SIGGRAPH 2026接收,在PSNR上超越先前方法+1.5至+5.0 dB。