通过生成先验蒸馏学习无配对监督的3D编辑
摘要
本文介绍了一种前馈3D编辑框架,该框架使用来自基础模型的生成先验蒸馏以避免配对训练数据,从而提高指令保真度和跨视角一致性。
查看缓存全文
缓存时间: 2026/09/09 16:32
论文页面 - 通过生成式先验蒸馏实现无配对监督的3D编辑学习
来源:https://huggingface.co/papers/2609.04942 发布于9月4日
·
wenhao (https://huggingface.co/costwen) 于9月9日
摘要
一种前馈式3D编辑框架,通过可微渲染和3D感知分布匹配,从基础模型中蒸馏视觉、语义和几何先验,以避免使用配对训练数据。
指令引导的3D编辑对于交互式内容创作至关重要,但它面临一个主要瓶颈:高质量配对训练数据的极度稀缺。现有方法试图通过依赖缓慢的测试时优化,或在通过复杂流程构建的伪配对数据上训练来绕过这个问题,但这通常会引入结构漂移和几何伪影。在本文中,我们提出了一种新颖的框架,通过生成式先验蒸馏,在无配对3D监督的情况下学习前馈式3D编辑。我们的核心思想不是依赖真实的3D配对数据,而是将视觉、语义和几何知识从强大的基础模型直接蒸馏到3D编辑模型中。具体而言,通过可微渲染管道,我们使用两种互补的信号来监督3D表示:在主要编辑视角上来自图像编辑模型的2D视觉先验,以及在新视角上来自视觉-语言模型的语义先验,以确保严格的指令遵循和源身份保持。至关重要的是,为了解决2D投影监督中固有的几何坍塌和多视角不一致问题,我们引入了3D感知分布匹配正则化。作为一个几何先验,该项在3D潜在空间中运行,约束编辑输出保持在由预训练图像到3D教师模型定义的真实3D资产流形内。大量实验表明,我们的方法实现了优越的指令保真度和跨视角一致性,显著优于最先进的基线。我们的项目页面为:https://github.com/thiamine128/PriorEdit3D。
查看 arXiv 页面 (https://arxiv.org/abs/2609.04942) 查看 PDF (https://arxiv.org/pdf/2609.04942) 项目页面 (https://thiamine128.github.io/PriorEdit3D/) GitHub (https://github.com/thiamine128/PriorEdit3D) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.04942)
在你的代理中获取此论文:
hf papers read 2609.04942
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型
0
没有模型链接此论文
在模型的 README.md 中引用 arxiv.org/abs/2609.04942 以从本页面链接它。
引用此论文的数据集
0
没有数据集链接此论文
在数据集的 README.md 中引用 arxiv.org/abs/2609.04942 以从本页面链接它。
引用此论文的 Spaces
0
没有 Space 链接此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2609.04942 以从本页面链接它。
包含此论文的收藏夹
0
没有收藏夹包含此论文
将此论文添加到收藏夹 (https://huggingface.co/new-collection) 以从本页面链接它。
相似文章
DanceOPD:基于策略的生成场蒸馏
DanceOPD提出了一种基于策略的生成场蒸馏框架,用于流匹配模型。该框架通过能力特定路由和基于速度的训练,统一了文本到图像生成、局部编辑和全局编辑,在保持基准生成质量的同时,提升了多能力组合。
生成作为辅助监督:通过解耦嵌入预测以零推理开销增强视觉理解
GAS 引入了一种生成引导的训练框架,通过解耦的混合Transformer架构,使用辅助生成任务来提高多模态模型中的视觉理解,且无推理开销。
通过概念扩展和密集监督释放图像编辑潜力
本文提出了一种针对扩散模型图像编辑的层次化分类法和密集监督训练策略,利用包含1200万编辑对的大型数据集和细粒度评估基准来提升模型性能。
VideoMDM: 基于2D监督的3D人体运动生成方法
VideoMDM利用扩散框架,通过2D重投影损失和3D运动正则化器,从2D姿态中训练3D人体运动先验,在无需3D真实数据的情况下实现了接近3D监督的性能。
先见后码:面向空间感知的教育动画生成中的视觉先验学习
本文介绍了 OmniManim,一个基于渲染反馈感知的框架,利用大语言模型从自然语言描述生成教育动画。它通过引入显式的视觉规划、渲染后诊断和局部修复来解决元素重叠、对齐错误等视觉缺陷,并在新构建的数据集上展示了改进的渲染质量。