通过生成先验蒸馏学习无配对监督的3D编辑

Hugging Face Daily Papers 论文

摘要

本文介绍了一种前馈3D编辑框架,该框架使用来自基础模型的生成先验蒸馏以避免配对训练数据,从而提高指令保真度和跨视角一致性。

指令引导的3D编辑对于交互式内容创作至关重要,但它面临一个重大瓶颈:高质量配对训练数据的严重匮乏。现有方法试图通过依赖缓慢的测试时优化或通过复杂流水线构建的伪配对进行训练来绕过这一问题,但这往往引入结构漂移和几何伪影。本文提出了一种新框架,通过生成先验蒸馏学习无配对3D监督的前馈3D编辑。我们的核心思想不是依赖真实的3D配对,而是从强大的基础模型中蒸馏视觉、语义和几何知识直接注入到3D编辑模型中。具体而言,通过一个可微分渲染流水线,我们使用两个互补信号来监督3D表示:主编辑视角的图像编辑模型提供的2D视觉先验,以及新视角的视觉语言模型提供的语义先验,以确保严格的指令遵循和源身份保留。至关重要的是,为了解决2D投影监督固有的几何坍塌和多视图不一致问题,我们引入了3D感知分布匹配正则化。作为一个几何先验,该术语在3D潜在空间中操作,约束编辑输出保持在预训练图像到3D教师模型定义的真实3D资产流形内。大量实验表明,我们的方法实现了优越的指令保真度和跨视图一致性,显著优于最先进的基线。我们的项目可在以下地址获取:https://github.com/thiamine128/PriorEdit3D。
查看原文
查看缓存全文

缓存时间: 2026/09/09 16:32

论文页面 - 通过生成式先验蒸馏实现无配对监督的3D编辑学习

来源:https://huggingface.co/papers/2609.04942 发布于9月4日

·

由 costwen 提交

wenhao (https://huggingface.co/costwen) 于9月9日

摘要

一种前馈式3D编辑框架,通过可微渲染和3D感知分布匹配,从基础模型中蒸馏视觉、语义和几何先验,以避免使用配对训练数据。

指令引导的3D编辑对于交互式内容创作至关重要,但它面临一个主要瓶颈:高质量配对训练数据的极度稀缺。现有方法试图通过依赖缓慢的测试时优化,或在通过复杂流程构建的伪配对数据上训练来绕过这个问题,但这通常会引入结构漂移和几何伪影。在本文中,我们提出了一种新颖的框架,通过生成式先验蒸馏,在无配对3D监督的情况下学习前馈式3D编辑。我们的核心思想不是依赖真实的3D配对数据,而是将视觉、语义和几何知识从强大的基础模型直接蒸馏到3D编辑模型中。具体而言,通过可微渲染管道,我们使用两种互补的信号来监督3D表示:在主要编辑视角上来自图像编辑模型的2D视觉先验,以及在新视角上来自视觉-语言模型的语义先验,以确保严格的指令遵循和源身份保持。至关重要的是,为了解决2D投影监督中固有的几何坍塌和多视角不一致问题,我们引入了3D感知分布匹配正则化。作为一个几何先验,该项在3D潜在空间中运行,约束编辑输出保持在由预训练图像到3D教师模型定义的真实3D资产流形内。大量实验表明,我们的方法实现了优越的指令保真度和跨视角一致性,显著优于最先进的基线。我们的项目页面为:https://github.com/thiamine128/PriorEdit3D。

查看 arXiv 页面 (https://arxiv.org/abs/2609.04942) 查看 PDF (https://arxiv.org/pdf/2609.04942) 项目页面 (https://thiamine128.github.io/PriorEdit3D/) GitHub (https://github.com/thiamine128/PriorEdit3D) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.04942)

在你的代理中获取此论文:

hf papers read 2609.04942

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型

0

没有模型链接此论文

在模型的 README.md 中引用 arxiv.org/abs/2609.04942 以从本页面链接它。

引用此论文的数据集

0

没有数据集链接此论文

在数据集的 README.md 中引用 arxiv.org/abs/2609.04942 以从本页面链接它。

引用此论文的 Spaces

0

没有 Space 链接此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2609.04942 以从本页面链接它。

包含此论文的收藏夹

0

没有收藏夹包含此论文

将此论文添加到收藏夹 (https://huggingface.co/new-collection) 以从本页面链接它。

相似文章

DanceOPD:基于策略的生成场蒸馏

Hugging Face Daily Papers

DanceOPD提出了一种基于策略的生成场蒸馏框架,用于流匹配模型。该框架通过能力特定路由和基于速度的训练,统一了文本到图像生成、局部编辑和全局编辑,在保持基准生成质量的同时,提升了多能力组合。

VideoMDM: 基于2D监督的3D人体运动生成方法

Hugging Face Daily Papers

VideoMDM利用扩散框架,通过2D重投影损失和3D运动正则化器,从2D姿态中训练3D人体运动先验,在无需3D真实数据的情况下实现了接近3D监督的性能。

先见后码:面向空间感知的教育动画生成中的视觉先验学习

arXiv cs.AI

本文介绍了 OmniManim,一个基于渲染反馈感知的框架,利用大语言模型从自然语言描述生成教育动画。它通过引入显式的视觉规划、渲染后诊断和局部修复来解决元素重叠、对齐错误等视觉缺陷,并在新构建的数据集上展示了改进的渲染质量。