CM-EVS:稀疏全景RGB-D位姿数据用于完整场景覆盖

Hugging Face Daily Papers 论文

摘要

本文提出了COVER,一种无需训练的方法,用于将3D资产转换为具有完整场景覆盖和低冗余度的稀疏全景RGB-D位姿数据,并介绍了包含36,373个来自室内和室外场景的精选帧的CM-EVS数据集。

现代3D视觉学习依赖于从度量3D资产中采样的观测数据,但现有的扫描、网格、点云、模拟和重建并不能直接提供一个稀疏、可比较且几何一致的全景训练接口。密集轨迹会重复相邻视角,特定源的渲染策略会产生异构标注,而稀疏启发式方法可能遗漏重要区域或引入深度不一致的观测。我们研究了如何将3D资产转换为稀疏的全景RGB-D位姿数据,在保持完整场景覆盖的同时实现低冗余度和可审计的来源追溯。我们提出了COVER(基于覆盖的视点策展方法,结合ERP范围深度变形),一种无需训练的ERP视点策展器,它将从选定视角观测到的几何投影到候选ERP探针上,对增量覆盖进行评分,并对深度冲突进行惩罚。在有界代理误差下,其贪心覆盖代理保留了标准的覆盖式近似行为,直到一个加性误差项。利用COVER,我们构建了CM-EVS(覆盖策展的度量ERP视点集),这是一个全景RGB-D位姿数据集,包含来自Blender室内、HM3D和ScanNet++中1,275个室内场景的36,373个精选ERP帧,并辅以来自TartanGround和OB3D的室外全景图(重新编码为相同模式)。每个帧提供全球面RGB、度量范围深度和校准位姿;COVER生成的室内帧包含逐步骤的来源日志。室内场景的中位数帧数仅为25帧,CM-EVS覆盖了所有13种统一房间类型,同时保持了紧凑的场景级覆盖。实验表明,COVER改善了覆盖-冲突权衡,使CM-EVS成为用于几何一致全景3D学习的稀疏、紧凑且可审计的RGB-D位姿资源。
查看原文
查看缓存全文

缓存时间: 2026/05/18 14:26

论文页面 - CM-EVS:用于完整场景覆盖的稀疏全景RGB-D-位姿数据

来源:https://huggingface.co/papers/2605.15597 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

现代三维视觉学习依赖于从度量三维资产中采样的观测数据,然而现有的扫描、网格、点云、仿真和重建并不能直接提供一个稀疏、可比较且几何一致的全景训练接口。密集轨迹会重复邻近视图,特定源的渲染策略会产生异构标注,而稀疏启发式方法可能遗漏重要区域或引入深度不一致的观测。我们研究了如何将3D资产转换为稀疏全景RGB-D-位姿数据,使其在保持完整场景覆盖的同时具有低冗余度和可审计的溯源。我们提出了COVER(面向覆盖的视点策展与ERP范围深度扭曲),这是一种无需训练的ERP视点策展器,它能将选定视点观测到的几何投影到候选ERP探针中,对增量覆盖进行评分,并对深度冲突进行惩罚。在有界代理误差下,其贪心覆盖代理保持了标准覆盖式逼近行为,直至一个附加误差项。利用COVER,我们构建了CM-EVS(覆盖策展的度量ERP视点集),这是一个全景RGB-D-位姿数据集,包含来自1,275个室内场景(涵盖Blenderindoor、HM3D和ScanNet++)的36,373个策展ERP帧,以及来自TartanGround和OB3D的室外全景图,这些全景图按相同模式重新编码。每个帧提供全球面RGB、度量范围深度和校准位姿;COVER生成的室内帧包含每一步的溯源日志。每个室内场景中位数仅25帧,CM-EVS覆盖了全部13种统一房间类型,同时保持了紧凑的场景级覆盖。实验表明,COVER改善了覆盖-冲突权衡,使CM-EVS成为用于几何一致全景三维学习的稀疏、紧凑且可审计的RGB-D-位姿资源。

查看arXiv页面 (https://arxiv.org/abs/2605.15597)查看PDF (https://arxiv.org/pdf/2605.15597)GitHub2 (https://github.com/Strange-animalss/CM-EVS)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.15597)

在你的代理中获取此论文:

hf papers read 2605.15597

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型链接此论文

在模型README.md中引用arxiv.org/abs/2605.15597即可从此页面链接。

引用此论文的数据集0

没有数据集链接此论文

在数据集README.md中引用arxiv.org/abs/2605.15597即可从此页面链接。

引用此论文的Spaces0

没有Space链接此论文

在Space README.md中引用arxiv.org/abs/2605.15597即可从此页面链接。

包含此论文的收藏0

没有收藏包含此论文

将此论文添加到收藏 (https://huggingface.co/new-collection)即可从此页面链接。

相似文章

从低重叠拍摄进行4D人体-场景重建

Hugging Face Daily Papers

提出StudioRecon,一种从低重叠相机拍摄中进行4D人体-场景重建的方法,使用背景(视频扩散)和人体(SMPL)的独立先验,并带有递归增强模块。已被SIGGRAPH 2026接收,在PSNR上超越先前方法+1.5至+5.0 dB。

基于多视角基础模型的统一全景几何估计

Hugging Face Daily Papers

PaGeR 适配了多视角透视基础模型 Depth Anything 3,利用固定的立方体贴图表示,从单张等距柱状投影图像中预测尺度不变深度、度量深度、表面法线和天空分割,同时保持 VRAM 和运行时间恒定。本文还发布了 ZüriPano 和 PanoInfinigen 数据集。

通过几何感知预训练增强上下文全景生成

Hugging Face Daily Papers

Canvas360是一个用于上下文全景生成的两阶段框架,结合了几何感知预训练与微调,通过大规模数据集和新颖的建模技术,提升了几何一致性与全局连贯性。