Self-Geometry:无真值且即插即用的测试时自适应方法,用于几何一致的3D视觉基础模型

Hugging Face Daily Papers 论文

摘要

提出了Self-Geometry,一种即插即用的测试时自适应流程,利用2D像素对应关系施加显式的多视图几何约束,以改进几何一致的3D视觉基础模型。

最近的视觉基础模型(VFM)在单次前向传播中预测深度、相机位姿和点图,无需针对每个场景进行优化,展现出强大的泛化能力。然而,强制执行显式的多视图几何一致性(例如通过束调整)计算成本高昂,因此在VFM预训练期间并未施加,从而可能出现这种不一致性。为了解决这个问题,从模型输出(例如点图、特征)推导出的隐式自一致性虽然在先前工作中已在测试时强制执行,但其性能提升本质上有限,尤其是在预训练VFM高度不准确的场景中。与这种隐式信号相反,我们提出了Self-Geometry,一种即插即用的测试时自适应流程,直接使用2D像素对应关系作为伪真值来施加显式的多视图几何约束。我们提出的Self-Geometry包括:几何解耦优化(Geometric Disentanglement Optimization),它结合了多视图一致性和对极一致性损失与梯度解耦,以防止梯度冲突;帧角邻域(Frame Angular-Neighbor),一种基于SO(3)测地距离的视图采样器,用于轻量地施加这些约束;以及轻量级TTA(Lightweight TTA),通过LoRA自适应VFM。我们的方法在六个VFM(VGGT、π^3、DA3-Giant/Large/Base/Small)和四个基准(7Scenes、ETH3D、ScanNet++、HiRoom)上的位姿和几何估计方面均取得了一致的改进。
查看原文
查看缓存全文

缓存时间: 2026/08/13 15:33

论文页面 - Self-Geometry:面向几何一致 3D 视觉基础模型的无真值即插即用测试时自适应

Source: https://huggingface.co/papers/2608.10708

摘要

Self-Geometry 通过测试时自适应(Test-Time Adaptation)结合 LoRA、解耦损失和角度邻域采样,强制执行显式多视图几何约束,从而提升视觉基础模型的预测性能。

近期视觉基础模型(VFMs)无需逐场景优化即可在单次前向传播中预测深度、相机位姿和点图,展现出强大的泛化能力。然而,强制执行显式多视图几何一致性(例如通过光束法平差)的计算成本高昂,因此 VFM 预训练期间并未施加该约束,从而可能导致此类不一致性。为了解决这一问题,先前的工作虽然会使用模型输出(如点图、特征)在测试时强制隐式自一致性,但性能提升本质上有限,尤其是在预训练 VFM 高度不准确的场景中。与这种隐式信号不同,我们提出 Self-Geometry,一种即插即用的测试时自适应流程,直接使用 2D 像素对应作为伪真值来强制执行显式多视图几何约束。我们提出的 Self-Geometry 包括:几何解耦优化,它结合多视图一致性对极一致性损失,并通过梯度解耦防止梯度冲突;Frame Angular-Neighbor,一种基于 SO(3) 测地距离的视图采样器,用于轻量地施加这些约束;以及 Lightweight TTA,它通过 LoRA 自适应 VFM。我们的方法在六个 VFM(VGGT、π^3、DA3-Giant/Large/Base/Small)和四个基准(7Scenes、ETH3D、ScanNet++、HiRoom)上,在姿态和几何估计方面均取得了持续改进。

查看 arXiv 页面 (https://arxiv.org/abs/2608.10708)查看 PDF (https://arxiv.org/pdf/2608.10708)项目页面 (https://cmlab-korea.github.io/Self-Geometry/)GitHub1 (https://github.com/CMLab-Korea/Self-Geometry)添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2608.10708)

在您的 agent 中获取此论文:

hf papers read 2608\.10708

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接到此论文

在模型 README.md 中引用 arxiv.org/abs/2608.10708 即可从本页链接到该模型。

引用此论文的数据集0

没有数据集链接到此论文

在数据集 README.md 中引用 arxiv.org/abs/2608.10708 即可从本页链接到该数据集。

引用此论文的 Space0

没有 Space 链接到此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2608.10708 即可从本页链接到该 Space。

包含此论文的收藏集0

没有包含此论文的收藏集

将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从本页链接到它。

相似文章

迈向一致视频几何估计

Hugging Face Daily Papers

ViGeo是一个基于Transformer的基础模型,使用动态分块注意力和基于补全的数据精炼框架,从视频中恢复密集且一致的3D几何,在多项任务上实现了最先进的性能。

SG-WAM:几何感知策略空间中的自引导世界建模

Hugging Face Daily Papers

本文提出SG-WAM,一种自引导框架,用于直接在策略派生的表示空间中学习几何感知的、以动作为条件的世界模型。它在LIBERO和LIBERO-Plus基准测试上取得了最先进的成功率,在真实世界评估中超越了强基线。

基于多视角基础模型的统一全景几何估计

Hugging Face Daily Papers

PaGeR 适配了多视角透视基础模型 Depth Anything 3,利用固定的立方体贴图表示,从单张等距柱状投影图像中预测尺度不变深度、度量深度、表面法线和天空分割,同时保持 VRAM 和运行时间恒定。本文还发布了 ZüriPano 和 PanoInfinigen 数据集。

几何至关重要:用于学习语义对应的3D基础先验

Hugging Face Daily Papers

本文介绍了一个后训练框架,利用SAM3D的3D先验来改进2D基础特征中的语义对应,解决了左右混淆和重复部分等问题。该方法使用实例特定的3D重建,无需姿态注释或球面几何捷径。