通过分解视觉代理的直接3D感知对象插入

Hugging Face Daily Papers 论文

摘要

本文介绍了DIRECT,一个用于姿态可控的3D感知对象插入的框架,它将条件分解为外观、几何和上下文引导,以实现具有显式3D姿态控制的高保真合成。

对象插入旨在将参考对象无缝合成到背景图像的指定区域中。最近的基于扩散的方法实现了高视觉质量,但将插入视为简单的2D修复任务,没有对对象的3D姿态进行显式控制,限制了其实用性。我们提出了DIRECT(用于参考合成与目标集成的分解注入),这是一个新颖的框架,它将交互式姿态操作与高保真2D图像合成相结合,以实现姿态可控的对象插入。我们的方法将插入条件分解为三个互补的组件:从参考对象捕捉视觉细节的外观引导、从用户调整的3D代理导出的几何引导,以及来自目标背景的上下文引导。通过分别注入这些信息,DIRECT避免了特征纠缠,同时保留了参考外观、遵循用户指定的姿态,并使对象适应目标场景。我们还引入了一个自动化的数据构建流水线,以提高训练数据的多样性和质量。实验表明,DIRECT在几何可控性和视觉质量方面均优于以前的方法。
查看原文
查看缓存全文

缓存时间: 2026/06/08 11:15

论文页面 - Direct 3D-Aware Object Insertion via Decomposed Visual Proxies

来源:https://huggingface.co/papers/2606.06601

摘要

基于扩散的物体插入框架,通过分解引导组件实现姿态控制

物体插入(https://huggingface.co/papers?q=Object%20insertion)旨在将参考物体无缝合成到背景图像的指定区域中。最近的基于扩散的方法(https://huggingface.co/papers?q=diffusion-based%20methods)实现了高视觉质量(https://huggingface.co/papers?q=visual%20quality),但将插入任务简单视为2D修补任务(https://huggingface.co/papers?q=inpainting%20task),无法对物体的3D姿态(https://huggingface.co/papers?q=3D%20pose)提供显式控制,限制了其实用性。我们提出 DIRECT(Decomposed Injection for Reference Composition and Target-integration),一种新颖框架,将交互式姿态操作(https://huggingface.co/papers?q=interactive%20pose%20manipulation)与高保真2D图像合成(https://huggingface.co/papers?q=2D%20image%20synthesis)相结合,实现姿态可控的物体插入(https://huggingface.co/papers?q=object%20insertion)。我们的方法将插入条件分解为三个互补组件:外观引导(https://huggingface.co/papers?q=appearance%20guidance)捕获参考物体的视觉细节,几何引导(https://huggingface.co/papers?q=geometry%20guidance)从用户调整的3D代理(https://huggingface.co/papers?q=3D%20proxy)中导出,以及上下文引导(https://huggingface.co/papers?q=context%20guidance)来自目标背景。通过将它们分别注入不同路径,DIRECT避免了特征纠缠(https://huggingface.co/papers?q=feature%20entanglement),同时保留了参考外观、遵循用户指定的姿态,并使物体适应目标场景。我们还引入了一个自动数据构建管道,以提高训练数据的多样性和质量。实验表明,DIRECT在几何可控性(https://huggingface.co/papers?q=geometric%20controllability)和视觉质量(https://huggingface.co/papers?q=visual%20quality)上均优于先前方法。

查看 arXiv 页面(https://arxiv.org/abs/2606.06601)查看 PDF(https://arxiv.org/pdf/2606.06601)项目页面(https://gong1130.github.io/DIRECT/)GitHub23(https://github.com/Gong1130/DIRECT)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.06601)

在你的 agent 中获取这篇论文:

hf papers read 2606.06601

没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型链接到此论文

在模型 README.md 中引用 arxiv.org/abs/2606.06601 可从此页面链接。

引用此论文的数据集0

没有数据集链接到此论文

在数据集 README.md 中引用 arxiv.org/abs/2606.06601 可从此页面链接。

引用此论文的 Space0

没有 Space 链接到此论文

在 Space README.md 中引用 arxiv.org/abs/2606.06601 可从此页面链接。

包含此论文的收藏集0

没有包含此论文的收藏集

将此论文添加到收藏集(https://huggingface.co/new-collection)可从此页面链接。

相似文章

显式层建模用于视频对象插入与层分解

Hugging Face Daily Papers

本文介绍了TriLayer,一个包含前景-背景-合成三元组的大规模视频数据集,以及DBL-Diffusion,一个用于显式分层视频表示的双分支扩散框架,实现了高保真度的对象插入和层分解。