场景即对象,而非基元:来自无位姿视图的实例结构化3D令牌化

Hugging Face Daily Papers 论文

摘要

本文提出了一种前馈框架,能够从无位姿的多视图图像中将3D场景分解为实例结构的令牌组,从而在没有3D标注的情况下实现直接的对象级重建、分割和操控。

3D场景是通过其对象而不是组成它们的基元来理解的。然而,前馈重建方法输出的是密集、无结构的点集或高斯集合,对象级结构需要事后恢复。我们提出了一种前馈框架,能够直接从无位姿的多视图图像中将场景分解为实例结构的3D令牌组——紧凑的以对象为中心的单元,重建、分割和操控都由此衍生。每个令牌组将一个捕获实体级身份的实例令牌与编码局部几何和外观的锚令牌配对,这些令牌随后被解码为一组3D高斯。这种两层级分解将对象身份与局部外观解耦,使得对象实例成为表示的原生接口,而非派生结果。令牌组通过可微渲染学习,并联合重建与分割监督,无需3D标注。我们的前馈模型在类别无关的实例分割上超越了逐场景优化基线,同时在新型视图合成上保持竞争力。除了这些指标外,相同的令牌组直接实现了实例级场景编辑——通过操作它们的组来移除、平移或插入对象——以及高效的开词汇3D实例检索,其中检索复杂度随实例数量而非基元数量扩展。
查看原文
查看缓存全文

缓存时间: 2026/07/01 11:42

Paper page - Scenes as Objects, Not Primitives: Instance-Structured 3D Tokenization from Unposed Views

来源:https://huggingface.co/papers/2606.29513

摘要

一种前馈框架从多视角图像中将3D场景分解为实例结构的 token 组,无需3D标注即可实现直接的对象级重建、分割与操作。

3D场景是通过其中的物体来理解的,而非构成它们的图元。然而,现有的前馈重建方法输出的是稠密、无结构的点集或高斯体,对象级结构需要事后才能恢复。我们提出了一种前馈框架 (https://huggingface.co/papers?q=feed-forward%20framework),它直接从无位姿的多视角图像 (https://huggingface.co/papers?q=unposed%20multi-view%20images) 中将场景分解为实例结构化的3D token 组——紧凑的对象中心单元,重建、分割和操作均可基于它们进行。每个 token 组将一个捕获实体级身份的实例 token 与多个描述局部几何与外观的锚点 token 配对,这些 token 被解码为一组3D高斯体 (https://huggingface.co/papers?q=3D%20Gaussians)。这种双层分解将对象身份与局部外观解耦,使对象实例成为表示的原生接口,而非衍生产物。这些 token 组通过可微渲染 (https://huggingface.co/papers?q=differentiable%20rendering) 联合重建与分割监督 (https://huggingface.co/papers?q=joint%20reconstruction%20and%20segmentation%20supervision) 学习得到,无需任何3D标注。我们的前馈模型在类别无关的实例分割 (https://huggingface.co/papers?q=class-agnostic%20instance%20segmentation) 上超越了逐场景优化基线,同时在新视角合成 (https://huggingface.co/papers?q=novel%20view%20synthesis) 方面保持了竞争力。除了这些指标外,相同的 token 组还直接支持实例级场景编辑 (https://huggingface.co/papers?q=instance-level%20scene%20editing)——通过操作这些组来删除、平移或插入物体——以及高效的开放词汇3D实例检索 (https://huggingface.co/papers?q=open-vocabulary%203D%20instance%20retrieval),其中检索复杂度随实例数量而非图元数量增长。

查看 arXiv 页面 (https://arxiv.org/abs/2606.29513)查看 PDF (https://arxiv.org/pdf/2606.29513)项目页面 (https://yoomimi.github.io/instok3d)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.29513)

在你的 agent 中获取这篇论文:

hf papers read 2606\.29513

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

暂无模型链接此论文

请在模型 README.md 中引用 arxiv.org/abs/2606.29513 以从此页面链接。

引用此论文的数据集0

暂无数据集链接此论文

请在数据集 README.md 中引用 arxiv.org/abs/2606.29513 以从此页面链接。

引用此论文的 Spaces0

暂无 Space 链接此论文

请在 Space README.md 中引用 arxiv.org/abs/2606.29513 以从此页面链接。

包含此论文的收藏集0

暂无收藏集包含此论文

请将此论文添加到一个收藏集 (https://huggingface.co/new-collection) 中以从此页面链接。

相似文章

词汇语义学的场景抽象:情境意义的结构化表示

arXiv cs.CL

本文提出了场景抽象(Scene Abstraction)框架,该框架利用大语言模型的少样本提示,构建单词在上下文中引发的解释性场景的结构化表示。作者引入了COCA-Scenes数据集,包含520个使用实例,并提供了实证证据表明场景是可可靠识别的,且比替代方案更符合人类解释。

TriSplat:面向仿真的前馈式三维场景重建

Hugging Face Daily Papers

TriSplat是一种前馈式三维重建网络,利用有向三角形图元直接从单张图像生成可直接用于仿真的网格,省去了昂贵的后处理步骤。该方法在保持竞争性的新视角渲染质量的同时,实现了几何保真的重建。

通过分解视觉代理的直接3D感知对象插入

Hugging Face Daily Papers

本文介绍了DIRECT,一个用于姿态可控的3D感知对象插入的框架,它将条件分解为外观、几何和上下文引导,以实现具有显式3D姿态控制的高保真合成。

从低重叠拍摄进行4D人体-场景重建

Hugging Face Daily Papers

提出StudioRecon,一种从低重叠相机拍摄中进行4D人体-场景重建的方法,使用背景(视频扩散)和人体(SMPL)的独立先验,并带有递归增强模块。已被SIGGRAPH 2026接收,在PSNR上超越先前方法+1.5至+5.0 dB。

从二维网格到一维标记:改革多模态图像融合的共享表示

Hugging Face Daily Papers

本文提出了一种多模态图像融合方法,该方法使用来自预训练图像标记器的一维标记接口,通过选择性标记编辑(STE)来增强全局外观一致性,同时保留局部细节。在四个基准上的实验表明,该方法在全局一致性和局部保真度方面均达到了最先进性能。