Block3D:基于块级扩散的高效文本到3D生成
摘要
Block3D 通过使用块级扩散和置信度引导的校正来加速文本到3D生成,减少推理时间,同时保持几何保真度,实现了5.15倍的加速。
查看缓存全文
缓存时间: 2026/08/25 08:35
论文页面 - Block3D:基于分块扩散的高效文本到3D生成
来源:https://huggingface.co/papers/2608.19567
摘要
Block3D 通过采用带置信度引导校正的分块扩散方法,在保持几何保真度的同时显著减少了推理时间,从而加速了文本到3D的生成过程。
尽管文本到3D生成(https://huggingface.co/papers?q=text-to-3D%20generation)技术发展迅速,但在低推理成本下实现高几何保真度仍然是一项挑战。现有的文本到3D方法要么自回归地解码离散形状标记(https://huggingface.co/papers?q=discrete%20shape%20tokens),要么通过扩散或流模型迭代优化全局3D表示。然而,自回归解码(https://huggingface.co/papers?q=autoregressive%20decoding)是顺序执行的,无法修正错误;而扩散和流匹配(https://huggingface.co/papers?q=flow-matching)模型则需要重复处理完整的表示,导致高质量生成的计算成本越来越高。本文提出了 Block3D,这是一个分块扩散(https://huggingface.co/papers?q=block-wise%20diffusion)框架。它将离散形状标记序列划分为连续的块,自回归地生成这些块,并对当前块内的所有标记进行联合去噪。为缓解误差累积,我们引入了置信度引导的块内校正(https://huggingface.co/papers?q=confidence-guided%20intra-block%20correction)机制,在每个块最终确定前修改低置信度的标记。在 TRELLIS-500K 的留出测试集上,Block3D 将平均端到端生成时间从 25.71 秒减少到 4.99 秒,在不牺牲几何保真度的情况下,比微调后的自回归基线实现了 5.15 倍的加速。
查看 arXiv 页面 (https://arxiv.org/abs/2608.19567) 查看 PDF (https://arxiv.org/pdf/2608.19567) 项目页面 (https://alexandertsui.github.io/block3d/) GitHub (https://github.com/ziplab/Block3D) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.19567)
通过你的代理获取本文:
hf papers read 2608.19567
还没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型0
尚无模型链接本文
在模型的 README.md 中引用 arxiv.org/abs/2608.19567 以从此页面链接到该模型。
引用本文的数据集0
尚无数据集链接本文
在数据集的 README.md 中引用 arxiv.org/abs/2608.19567 以从此页面链接到该数据集。
引用本文的 Space0
尚无 Space 链接本文
在 Space 的 README.md 中引用 arxiv.org/abs/2608.19567 以从此页面链接到该 Space。
包含本文的收藏集0
尚无收藏集包含本文
将本文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接到该收藏集。
相似文章
DiffusionGemma: 文本生成速度提升4倍
Google推出DiffusionGemma,这是一个实验性的26B MoE开源模型,通过文本扩散技术,在GPU上实现高达4倍的文本生成速度提升,针对速度要求高的交互式本地工作流。
我渴望在我的Strix Halo上获得15倍加速
Nvidia声称使用扩散模型在文本生成上实现15倍加速,一次性生成整个文本块。
Flash-BoN:扩散模型推理时扩展的即时草稿
Flash-BoN 通过时间步截断、层跳过和激活代理生成廉价的草稿候选,然后使用多阶段验证选择最佳草稿进行完整细化,从而在固定挂钟预算下优于基线,提高文本到图像生成的效率。
Hunyuan3D 2.0:扩展扩散模型以生成高分辨率纹理3D资产
Hunyuan3D 2.0 是一个可扩展的基于流的扩散变换器系统,用于生成高分辨率纹理3D资产,性能优于当前最先进的模型,并已公开发布代码和权重。
迈向光速文本生成:Nemotron-Labs扩散语言模型
NVIDIA推出Nemotron-Labs Diffusion,这是一系列扩散语言模型,可并行生成文本并迭代优化,从而提供更快的生成速度并支持修订之前的令牌。