基于多视角基础模型的统一全景几何估计
摘要
PaGeR 适配了多视角透视基础模型 Depth Anything 3,利用固定的立方体贴图表示,从单张等距柱状投影图像中预测尺度不变深度、度量深度、表面法线和天空分割,同时保持 VRAM 和运行时间恒定。本文还发布了 ZüriPano 和 PanoInfinigen 数据集。
查看缓存全文
缓存时间: 2026/05/29 03:00
论文页面 - 统一全景几何估计:基于多视角基础模型
来源:https://huggingface.co/papers/2605.26368
摘要:PaGeR将透视3D基础模型转化为单次处理的360°几何估计器——从一张等距柱状投影图像中,它能在全全景分辨率下预测尺度不变深度、公制度量深度(以米为单位)、表面法线和天空分割。
我们提出PaGeR(全景几何重建),通过固定的6×504×504立方体贴图,将多视角透视基础模型(Depth Anything 3)提升至全景领域,因此无论输入分辨率如何,显存和运行时间都保持恒定。单次前向传播即可返回尺度不变+公制度量深度、世界坐标系法线和天空掩码。我们还发布了两个新数据集——ZüriPano(真实评估)和PanoInfinigen(合成训练)。
🔗 项目页面:https://pager360.github.io/ · 🤗 演示:https://huggingface.co/spaces/prs-eth/PaGeR · 合集(模型+数据集):https://huggingface.co/collections/prs-eth/pager-697241d06b3733a6f18e4d39 · 代码:https://github.com/prs-eth/PaGeR
欢迎提问!
相似文章
PanoWorld:真实世界全景生成
PanoWorld提出了一种利用旋转等变表示实现全景世界模型中长程记忆的方法,包含三阶段训练流程和全新大规模数据集World360。该模型以大幅优势超越了其他方法。
通过几何感知预训练增强上下文全景生成
Canvas360是一个用于上下文全景生成的两阶段框架,结合了几何感知预训练与微调,通过大规模数据集和新颖的建模技术,提升了几何一致性与全局连贯性。
PanoWorld: 迈向360度全景世界中的空间超感知
PanoWorld引入了球形空间交叉注意力机制用于全景推理,解决了多模态大语言模型在360度空间理解中的局限性。它构建了一个大规模管线用于几何感知监督,并提出一个诊断性基准,在多个基准上取得了最先进的结果。
同一场景,两种深度:探索单目基础模型中的几何模糊性
引入MultiDepth-3k基准,用于评估单目深度基础模型中的深度层偏好,并展示拉普拉斯视觉提示(Laplacian Visual Prompting)可以改变报告的深度层,表明不同模型之间存在互补的几何假设。
MoVerse: 实时视频世界建模与全景高斯脚手架
MoVerse 通过创建360°全景图和3D高斯脚手架,从单张图像生成实时交互式视频,利用基于扩散的技术实现高效渲染。