CM-EVS:稀疏全景RGB-D位姿数据用于完整场景覆盖
摘要
本文提出了COVER,一种无需训练的方法,用于将3D资产转换为具有完整场景覆盖和低冗余度的稀疏全景RGB-D位姿数据,并介绍了包含36,373个来自室内和室外场景的精选帧的CM-EVS数据集。
查看缓存全文
缓存时间: 2026/05/18 14:26
论文页面 - CM-EVS:用于完整场景覆盖的稀疏全景RGB-D-位姿数据
来源:https://huggingface.co/papers/2605.15597 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
现代三维视觉学习依赖于从度量三维资产中采样的观测数据,然而现有的扫描、网格、点云、仿真和重建并不能直接提供一个稀疏、可比较且几何一致的全景训练接口。密集轨迹会重复邻近视图,特定源的渲染策略会产生异构标注,而稀疏启发式方法可能遗漏重要区域或引入深度不一致的观测。我们研究了如何将3D资产转换为稀疏全景RGB-D-位姿数据,使其在保持完整场景覆盖的同时具有低冗余度和可审计的溯源。我们提出了COVER(面向覆盖的视点策展与ERP范围深度扭曲),这是一种无需训练的ERP视点策展器,它能将选定视点观测到的几何投影到候选ERP探针中,对增量覆盖进行评分,并对深度冲突进行惩罚。在有界代理误差下,其贪心覆盖代理保持了标准覆盖式逼近行为,直至一个附加误差项。利用COVER,我们构建了CM-EVS(覆盖策展的度量ERP视点集),这是一个全景RGB-D-位姿数据集,包含来自1,275个室内场景(涵盖Blenderindoor、HM3D和ScanNet++)的36,373个策展ERP帧,以及来自TartanGround和OB3D的室外全景图,这些全景图按相同模式重新编码。每个帧提供全球面RGB、度量范围深度和校准位姿;COVER生成的室内帧包含每一步的溯源日志。每个室内场景中位数仅25帧,CM-EVS覆盖了全部13种统一房间类型,同时保持了紧凑的场景级覆盖。实验表明,COVER改善了覆盖-冲突权衡,使CM-EVS成为用于几何一致全景三维学习的稀疏、紧凑且可审计的RGB-D-位姿资源。
查看arXiv页面 (https://arxiv.org/abs/2605.15597)查看PDF (https://arxiv.org/pdf/2605.15597)GitHub2 (https://github.com/Strange-animalss/CM-EVS)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.15597)
在你的代理中获取此论文:
hf papers read 2605.15597
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接此论文
在模型README.md中引用arxiv.org/abs/2605.15597即可从此页面链接。
引用此论文的数据集0
没有数据集链接此论文
在数据集README.md中引用arxiv.org/abs/2605.15597即可从此页面链接。
引用此论文的Spaces0
没有Space链接此论文
在Space README.md中引用arxiv.org/abs/2605.15597即可从此页面链接。
包含此论文的收藏0
没有收藏包含此论文
将此论文添加到收藏 (https://huggingface.co/new-collection)即可从此页面链接。
相似文章
@Michael_J_Black: 今日ECCV: 走向野外自我中心3D手部-物体姿态估计, 展览厅海报: #70, 下午CEST, 海报环节…
本文介绍了EPIC-Contact,一个用于3D手部-物体姿态估计的野外数据集,以及HOPformer,一个Transformer模型,能够从单张RGB图像联合预测手部和物体姿态。
从低重叠拍摄进行4D人体-场景重建
提出StudioRecon,一种从低重叠相机拍摄中进行4D人体-场景重建的方法,使用背景(视频扩散)和人体(SMPL)的独立先验,并带有递归增强模块。已被SIGGRAPH 2026接收,在PSNR上超越先前方法+1.5至+5.0 dB。
基于多视角基础模型的统一全景几何估计
PaGeR 适配了多视角透视基础模型 Depth Anything 3,利用固定的立方体贴图表示,从单张等距柱状投影图像中预测尺度不变深度、度量深度、表面法线和天空分割,同时保持 VRAM 和运行时间恒定。本文还发布了 ZüriPano 和 PanoInfinigen 数据集。
@vincieye: 从几张照片生成完整的3D场景通常意味着凭空想象盲点或内存爆炸。SPAR3S s…
SPAR3S是一种稀疏自回归生成模型,能高效地从稀疏多视角图像生成完整的3D场景,无需3D真值数据,使用体素对齐的潜在空间和可微分的3D Gaussian Splatting。
通过几何感知预训练增强上下文全景生成
Canvas360是一个用于上下文全景生成的两阶段框架,结合了几何感知预训练与微调,通过大规模数据集和新颖的建模技术,提升了几何一致性与全局连贯性。