通过分解视觉代理的直接3D感知对象插入
摘要
本文介绍了DIRECT,一个用于姿态可控的3D感知对象插入的框架,它将条件分解为外观、几何和上下文引导,以实现具有显式3D姿态控制的高保真合成。
查看缓存全文
缓存时间: 2026/06/08 11:15
论文页面 - Direct 3D-Aware Object Insertion via Decomposed Visual Proxies
来源:https://huggingface.co/papers/2606.06601
摘要
基于扩散的物体插入框架,通过分解引导组件实现姿态控制
物体插入(https://huggingface.co/papers?q=Object%20insertion)旨在将参考物体无缝合成到背景图像的指定区域中。最近的基于扩散的方法(https://huggingface.co/papers?q=diffusion-based%20methods)实现了高视觉质量(https://huggingface.co/papers?q=visual%20quality),但将插入任务简单视为2D修补任务(https://huggingface.co/papers?q=inpainting%20task),无法对物体的3D姿态(https://huggingface.co/papers?q=3D%20pose)提供显式控制,限制了其实用性。我们提出 DIRECT(Decomposed Injection for Reference Composition and Target-integration),一种新颖框架,将交互式姿态操作(https://huggingface.co/papers?q=interactive%20pose%20manipulation)与高保真2D图像合成(https://huggingface.co/papers?q=2D%20image%20synthesis)相结合,实现姿态可控的物体插入(https://huggingface.co/papers?q=object%20insertion)。我们的方法将插入条件分解为三个互补组件:外观引导(https://huggingface.co/papers?q=appearance%20guidance)捕获参考物体的视觉细节,几何引导(https://huggingface.co/papers?q=geometry%20guidance)从用户调整的3D代理(https://huggingface.co/papers?q=3D%20proxy)中导出,以及上下文引导(https://huggingface.co/papers?q=context%20guidance)来自目标背景。通过将它们分别注入不同路径,DIRECT避免了特征纠缠(https://huggingface.co/papers?q=feature%20entanglement),同时保留了参考外观、遵循用户指定的姿态,并使物体适应目标场景。我们还引入了一个自动数据构建管道,以提高训练数据的多样性和质量。实验表明,DIRECT在几何可控性(https://huggingface.co/papers?q=geometric%20controllability)和视觉质量(https://huggingface.co/papers?q=visual%20quality)上均优于先前方法。
查看 arXiv 页面(https://arxiv.org/abs/2606.06601)查看 PDF(https://arxiv.org/pdf/2606.06601)项目页面(https://gong1130.github.io/DIRECT/)GitHub23(https://github.com/Gong1130/DIRECT)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.06601)
在你的 agent 中获取这篇论文:
hf papers read 2606.06601
没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接到此论文
在模型 README.md 中引用 arxiv.org/abs/2606.06601 可从此页面链接。
引用此论文的数据集0
没有数据集链接到此论文
在数据集 README.md 中引用 arxiv.org/abs/2606.06601 可从此页面链接。
引用此论文的 Space0
没有 Space 链接到此论文
在 Space README.md 中引用 arxiv.org/abs/2606.06601 可从此页面链接。
包含此论文的收藏集0
没有包含此论文的收藏集
将此论文添加到收藏集(https://huggingface.co/new-collection)可从此页面链接。
相似文章
DeVI:基于物理的灵巧人-物交互,通过合成视频模仿实现
DeVI 提出一种框架,借助混合 3D-2D 跟踪奖励,将文本驱动的合成视频转化为具备物理可信度的灵巧机器人控制,实现对未见物体的零样本泛化。
场景即对象,而非基元:来自无位姿视图的实例结构化3D令牌化
本文提出了一种前馈框架,能够从无位姿的多视图图像中将3D场景分解为实例结构的令牌组,从而在没有3D标注的情况下实现直接的对象级重建、分割和操控。
显式层建模用于视频对象插入与层分解
本文介绍了TriLayer,一个包含前景-背景-合成三元组的大规模视频数据集,以及DBL-Diffusion,一个用于显式分层视频表示的双分支扩散框架,实现了高保真度的对象插入和层分解。
Pantheon360: 通过3D感知360度视频扩散驯服数字孪生生成
Pantheon360引入了一种3D感知360度视频扩散框架,该框架使用显式3D缓存来强制执行几何一致性,从而能够从稀疏360度输入中生成高保真数字孪生。
CoInteract:通过空间结构化协同生成实现物理一致的人-物交互视频合成
CoInteract 提出端到端 Diffusion Transformer 框架,联合建模 RGB 外观与 HOI 几何,在零推理开销下生成物理合理、手脸稳定的人-物交互视频。