场景即对象,而非基元:来自无位姿视图的实例结构化3D令牌化
摘要
本文提出了一种前馈框架,能够从无位姿的多视图图像中将3D场景分解为实例结构的令牌组,从而在没有3D标注的情况下实现直接的对象级重建、分割和操控。
查看缓存全文
缓存时间: 2026/07/01 11:42
Paper page - Scenes as Objects, Not Primitives: Instance-Structured 3D Tokenization from Unposed Views
来源:https://huggingface.co/papers/2606.29513
摘要
一种前馈框架从多视角图像中将3D场景分解为实例结构的 token 组,无需3D标注即可实现直接的对象级重建、分割与操作。
3D场景是通过其中的物体来理解的,而非构成它们的图元。然而,现有的前馈重建方法输出的是稠密、无结构的点集或高斯体,对象级结构需要事后才能恢复。我们提出了一种前馈框架 (https://huggingface.co/papers?q=feed-forward%20framework),它直接从无位姿的多视角图像 (https://huggingface.co/papers?q=unposed%20multi-view%20images) 中将场景分解为实例结构化的3D token 组——紧凑的对象中心单元,重建、分割和操作均可基于它们进行。每个 token 组将一个捕获实体级身份的实例 token 与多个描述局部几何与外观的锚点 token 配对,这些 token 被解码为一组3D高斯体 (https://huggingface.co/papers?q=3D%20Gaussians)。这种双层分解将对象身份与局部外观解耦,使对象实例成为表示的原生接口,而非衍生产物。这些 token 组通过可微渲染 (https://huggingface.co/papers?q=differentiable%20rendering) 联合重建与分割监督 (https://huggingface.co/papers?q=joint%20reconstruction%20and%20segmentation%20supervision) 学习得到,无需任何3D标注。我们的前馈模型在类别无关的实例分割 (https://huggingface.co/papers?q=class-agnostic%20instance%20segmentation) 上超越了逐场景优化基线,同时在新视角合成 (https://huggingface.co/papers?q=novel%20view%20synthesis) 方面保持了竞争力。除了这些指标外,相同的 token 组还直接支持实例级场景编辑 (https://huggingface.co/papers?q=instance-level%20scene%20editing)——通过操作这些组来删除、平移或插入物体——以及高效的开放词汇3D实例检索 (https://huggingface.co/papers?q=open-vocabulary%203D%20instance%20retrieval),其中检索复杂度随实例数量而非图元数量增长。
查看 arXiv 页面 (https://arxiv.org/abs/2606.29513)查看 PDF (https://arxiv.org/pdf/2606.29513)项目页面 (https://yoomimi.github.io/instok3d)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.29513)
在你的 agent 中获取这篇论文:
hf papers read 2606\.29513
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
暂无模型链接此论文
请在模型 README.md 中引用 arxiv.org/abs/2606.29513 以从此页面链接。
引用此论文的数据集0
暂无数据集链接此论文
请在数据集 README.md 中引用 arxiv.org/abs/2606.29513 以从此页面链接。
引用此论文的 Spaces0
暂无 Space 链接此论文
请在 Space README.md 中引用 arxiv.org/abs/2606.29513 以从此页面链接。
包含此论文的收藏集0
暂无收藏集包含此论文
请将此论文添加到一个收藏集 (https://huggingface.co/new-collection) 中以从此页面链接。
相似文章
词汇语义学的场景抽象:情境意义的结构化表示
本文提出了场景抽象(Scene Abstraction)框架,该框架利用大语言模型的少样本提示,构建单词在上下文中引发的解释性场景的结构化表示。作者引入了COCA-Scenes数据集,包含520个使用实例,并提供了实证证据表明场景是可可靠识别的,且比替代方案更符合人类解释。
TriSplat:面向仿真的前馈式三维场景重建
TriSplat是一种前馈式三维重建网络,利用有向三角形图元直接从单张图像生成可直接用于仿真的网格,省去了昂贵的后处理步骤。该方法在保持竞争性的新视角渲染质量的同时,实现了几何保真的重建。
通过分解视觉代理的直接3D感知对象插入
本文介绍了DIRECT,一个用于姿态可控的3D感知对象插入的框架,它将条件分解为外观、几何和上下文引导,以实现具有显式3D姿态控制的高保真合成。
从低重叠拍摄进行4D人体-场景重建
提出StudioRecon,一种从低重叠相机拍摄中进行4D人体-场景重建的方法,使用背景(视频扩散)和人体(SMPL)的独立先验,并带有递归增强模块。已被SIGGRAPH 2026接收,在PSNR上超越先前方法+1.5至+5.0 dB。
从二维网格到一维标记:改革多模态图像融合的共享表示
本文提出了一种多模态图像融合方法,该方法使用来自预训练图像标记器的一维标记接口,通过选择性标记编辑(STE)来增强全局外观一致性,同时保留局部细节。在四个基准上的实验表明,该方法在全局一致性和局部保真度方面均达到了最先进性能。