3D视觉烹饪书:数据、学习范式与应用
摘要
本文提出了3D视觉研究的全面分类体系,涵盖几何表示、数据集、学习范式以及在重建、生成和视频建模中的应用。
查看缓存全文
缓存时间: 2026/06/08 19:17
论文页面 - 3D视觉菜谱:数据、学习范式与应用
来源:https://huggingface.co/papers/2606.04291 发表于6月2日
·
提交者https://huggingface.co/zli12321
LZX (https://huggingface.co/zli12321)于6月8日
作者:, , , , , , , , ,
摘要
3D视觉研究通过一个分类体系组织,该分类体系将几何表示、数据集、学习框架以及在重建、生成和视频建模任务中的应用联系起来。
3D视觉在日益多样化的数据表示、学习范式和建模策略的推动下迅速发展。然而,该领域在表示和基准测试方面仍然零散,使得难以对效率、保真度和可扩展性形成统一观点。本文提供了一个以数据为中心的3D视觉分类体系,将几何表示、数据集、学习框架和应用整合在单一概念图中。我们首先分析3D数据的主要结构表示——点云、网格、体素和3D高斯——以及它们的获取流程。然后我们审视数据集设计、基准构建和监督机制如何塑造最新进展,涵盖2D监督的3D学习、隐式神经表示和4D世界建模。通过这一整合视角,我们阐明了表示、学习范式与下游任务在重建、生成和视频建模中的关系,提供了对平衡效率与保真度以及多模态几何基础化新兴趋势的统一看法。
查看arXiv页面 (https://arxiv.org/abs/2606.04291)查看PDF (https://arxiv.org/pdf/2606.04291)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.04291)
在您的代理中获取此论文:
hf papers read 2606\.04291
没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
在模型README.md中引用arxiv.org/abs/2606.04291以从此页面链接。
引用此论文的数据集0
没有数据集链接此论文
在数据集README.md中引用arxiv.org/abs/2606.04291以从此页面链接。
引用此论文的Spaces0
没有Space链接此论文
在Space README.md中引用arxiv.org/abs/2606.04291以从此页面链接。
包含此论文的收藏0
没有包含此论文的收藏
将此论文添加到收藏以从此页面链接。
相似文章
AnyRecon:基于视频扩散模型的任意视角 3D 重建
AnyRecon 提出了一种可扩展框架,利用具备持久场景记忆与几何感知条件的视频扩散模型,从任意稀疏输入进行 3D 重建。
@ninaddaithankar: 视觉模型能否在没有数据增强、掩码、裁剪或重建的情况下学会观察?它可以!介绍……
介绍了时间差视觉表征学习范式(Temporal Difference in Vision, TDV),这是一种新颖的视觉表征学习范式,无需数据增强、掩码、裁剪或重建即可学习有用的表征,并在密集空间任务上达到与最先进方法相当的性能。
3DCodeBench:通过代码对智能体过程化3D建模进行基准测试
本文介绍了3DCodeBench——一个用于评估视觉语言模型通过代码进行过程化3D建模的基准测试,以及3DCodeArena——一个基于成对人类偏好的排名平台。
DataComp-VLM:面向视觉语言模型的改进型开放数据集
本文介绍了DataComp-VLM(DCVLM),这是一个用于评估视觉语言模型数据策展策略的综合基准。作者发现,数据混合而非数据过滤能显著提升性能,由此产生的DCVLM-Baseline数据集在33项下游任务中取得了最先进的结果。
场景即对象,而非基元:来自无位姿视图的实例结构化3D令牌化
本文提出了一种前馈框架,能够从无位姿的多视图图像中将3D场景分解为实例结构的令牌组,从而在没有3D标注的情况下实现直接的对象级重建、分割和操控。