Self-Geometry:无真值且即插即用的测试时自适应方法,用于几何一致的3D视觉基础模型
摘要
提出了Self-Geometry,一种即插即用的测试时自适应流程,利用2D像素对应关系施加显式的多视图几何约束,以改进几何一致的3D视觉基础模型。
查看缓存全文
缓存时间: 2026/08/13 15:33
论文页面 - Self-Geometry:面向几何一致 3D 视觉基础模型的无真值即插即用测试时自适应
Source: https://huggingface.co/papers/2608.10708
摘要
Self-Geometry 通过测试时自适应(Test-Time Adaptation)结合 LoRA、解耦损失和角度邻域采样,强制执行显式多视图几何约束,从而提升视觉基础模型的预测性能。
近期视觉基础模型(VFMs)无需逐场景优化即可在单次前向传播中预测深度、相机位姿和点图,展现出强大的泛化能力。然而,强制执行显式多视图几何一致性(例如通过光束法平差)的计算成本高昂,因此 VFM 预训练期间并未施加该约束,从而可能导致此类不一致性。为了解决这一问题,先前的工作虽然会使用模型输出(如点图、特征)在测试时强制隐式自一致性,但性能提升本质上有限,尤其是在预训练 VFM 高度不准确的场景中。与这种隐式信号不同,我们提出 Self-Geometry,一种即插即用的测试时自适应流程,直接使用 2D 像素对应作为伪真值来强制执行显式多视图几何约束。我们提出的 Self-Geometry 包括:几何解耦优化,它结合多视图一致性与对极一致性损失,并通过梯度解耦防止梯度冲突;Frame Angular-Neighbor,一种基于 SO(3) 测地距离的视图采样器,用于轻量地施加这些约束;以及 Lightweight TTA,它通过 LoRA 自适应 VFM。我们的方法在六个 VFM(VGGT、π^3、DA3-Giant/Large/Base/Small)和四个基准(7Scenes、ETH3D、ScanNet++、HiRoom)上,在姿态和几何估计方面均取得了持续改进。
查看 arXiv 页面 (https://arxiv.org/abs/2608.10708)查看 PDF (https://arxiv.org/pdf/2608.10708)项目页面 (https://cmlab-korea.github.io/Self-Geometry/)GitHub1 (https://github.com/CMLab-Korea/Self-Geometry)添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2608.10708)
在您的 agent 中获取此论文:
hf papers read 2608\.10708
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接到此论文
在模型 README.md 中引用 arxiv.org/abs/2608.10708 即可从本页链接到该模型。
引用此论文的数据集0
没有数据集链接到此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.10708 即可从本页链接到该数据集。
引用此论文的 Space0
没有 Space 链接到此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2608.10708 即可从本页链接到该 Space。
包含此论文的收藏集0
没有包含此论文的收藏集
将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从本页链接到它。
相似文章
迈向一致视频几何估计
ViGeo是一个基于Transformer的基础模型,使用动态分块注意力和基于补全的数据精炼框架,从视频中恢复密集且一致的3D几何,在多项任务上实现了最先进的性能。
CGGS: 一致性增强的几何高斯泼溅用于第一人称3D场景生成
CGGS是一个文本到3D的框架,通过使用一致性增强损失、布局装饰和基于熵的深度损失的几何细化等多阶段方法,提高了第一人称3D场景生成中的几何一致性和质量。
SG-WAM:几何感知策略空间中的自引导世界建模
本文提出SG-WAM,一种自引导框架,用于直接在策略派生的表示空间中学习几何感知的、以动作为条件的世界模型。它在LIBERO和LIBERO-Plus基准测试上取得了最先进的成功率,在真实世界评估中超越了强基线。
基于多视角基础模型的统一全景几何估计
PaGeR 适配了多视角透视基础模型 Depth Anything 3,利用固定的立方体贴图表示,从单张等距柱状投影图像中预测尺度不变深度、度量深度、表面法线和天空分割,同时保持 VRAM 和运行时间恒定。本文还发布了 ZüriPano 和 PanoInfinigen 数据集。
几何至关重要:用于学习语义对应的3D基础先验
本文介绍了一个后训练框架,利用SAM3D的3D先验来改进2D基础特征中的语义对应,解决了左右混淆和重复部分等问题。该方法使用实例特定的3D重建,无需姿态注释或球面几何捷径。