将3D生成模型用于自回归布局生成
摘要
LaviGen是一个框架,它重用3D生成模型进行自回归3D布局生成,使用改进的3D扩散模型和dual-guidance self-rollout蒸馏机制,在LayoutVLM基准上实现了比最先进方法高19%的物理合理性和快65%的计算速度。
查看缓存全文
缓存时间: 2026/04/20 08:27
论文页面 - 将3D生成模型改造用于自回归布局生成
来源:https://huggingface.co/papers/2604.16299
摘要
LaviGen 提出了一种3D布局生成框架,该框架使用经过适配的3D扩散模型,并引入双重引导自展蒸馏机制,以提升效率与空间精度。
我们提出 LaviGen 框架,可将3D生成模型 (https://huggingface.co/papers?q=3D%20generative%20models) 改造用于3D布局生成 (https://huggingface.co/papers?q=3D%20layout%20generation)。与以往从文本描述推断物体布局的方法不同,LaviGen 直接在原生3D空间中运行,将布局生成构建为自回归过程 (https://huggingface.co/papers?q=autoregressive%20process),显式建模物体间的几何关系 (https://huggingface.co/papers?q=geometric%20relations) 与物理约束 (https://huggingface.co/papers?q=physical%20constraints),从而生成连贯且物理合理的3D场景。为进一步增强这一过程,我们提出一种经过适配的3D扩散模型 (https://huggingface.co/papers?q=3D%20diffusion%20model),该模型融合了场景、物体与指令信息,并采用双重引导自展蒸馏 (https://huggingface.co/papers?q=dual-guidance%20self-rollout%20distillation) 机制以提高效率与空间精度。在 LayoutVLM 基准 (https://huggingface.co/papers?q=LayoutVLM%20benchmark) 上的大量实验表明,LaviGen 在3D布局生成 (https://huggingface.co/papers?q=3D%20layout%20generation) 性能上表现优异,物理合理性比现有最优方法高出19%,计算速度提升65%。我们的代码已在 https://github.com/fenghora/LaviGen 公开。
查看 arXiv 页面 (https://arxiv.org/abs/2604.16299) 查看 PDF (https://arxiv.org/pdf/2604.16299) 项目页面 (https://fenghora.github.io/LaviGen-Page/) GitHub10 (https://github.com/fenghora/LaviGen) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2604.16299)
在您的智能体中获取此论文:
hf papers read 2604.16299
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型关联此论文
请在模型 README.md 中引用 arxiv.org/abs/2604.16299 以从此页面链接。
引用此论文的数据集0
没有数据集关联此论文
请在数据集 README.md 中引用 arxiv.org/abs/2604.16299 以从此页面链接。
引用此论文的 Spaces0
没有 Space 关联此论文
请在 Space README.md 中引用 arxiv.org/abs/2604.16299 以从此页面链接。
包含此论文的合集0
没有合集包含此论文
请将此论文添加到一个合集 (https://huggingface.co/new-collection) 中以从此页面链接。
相似文章
加速视觉生成式LLMs的解耦RL:基于扩散并行与训练器辅助生成
本文介绍了DigenRL,一个用于基于扩散的生成式LLMs的解耦RL框架,它利用生成轴流水线并行和训练器辅助生成,相比现有系统实现了1.56-2.10倍的吞吐量提升。
基于强化学习与可验证奖励的LLM生成式楼层平面设计
本文介绍了一种基于文本的生成式楼层平面设计方法,该方法通过强化学习与可验证奖励对大语言模型进行微调,以提高对拓扑和数值约束的遵循程度,与现有方法相比取得了显著改进。
面向3D生成的原生紧凑结构潜变量
本文介绍了O-Voxel,一种用于3D生成建模的新型稀疏体素表示方法,能够高效处理复杂拓扑和外观,并训练了包含4B参数的大规模流匹配模型,实现了最先进的生成质量。
通过轻量级结构引导的自回归模型实现新型图生成的可扩展性
研究人员提出了一种用于图生成的轻量级自回归框架,该框架使用结构引导的拓扑排序实现了接近对数线性的复杂度,解决了现有扩散和自回归方法在可扩展性和新颖性方面的局限性。该方法同时支持LSTM和Mamba风格的主干网络,在分子和非分子基准测试中展示了改进的新颖性,同时保持了有效性和独特性。
语言生成作为最优控制:潜在控制空间中的闭环扩散
本文将语言生成重新表述为随机最优控制问题,解决了自回归和扩散模型的局限性,并提出了使用Flow Matching在潜在控制空间中的闭环扩散方法,实现了高保真生成和高效并行采样。