Block3D:基于块级扩散的高效文本到3D生成

Hugging Face Daily Papers 论文

摘要

Block3D 通过使用块级扩散和置信度引导的校正来加速文本到3D生成,减少推理时间,同时保持几何保真度,实现了5.15倍的加速。

尽管文本到3D生成已快速进步,但在低推理成本下实现高几何保真度仍具挑战性。现有的文本到3D方法要么自回归解码离散形状标记,要么使用扩散或流模型迭代细化全局3D表示。然而,自回归解码是顺序的,无法修正错误,而扩散和流匹配模型重复处理完整表示,使得高质量生成成本越来越高。本文提出Block3D,一个块级扩散框架,将离散形状标记序列划分为连续块,自回归生成各块,并联合去噪当前块内的所有标记。为缓解误差累积,我们引入置信度引导的块内校正,在最终确定每个块之前修正低置信度标记。在TRELLIS-500K的保留集上,Block3D将平均端到端生成时间从25.71秒减少到4.99秒,相比微调的自回归基线实现了5.15倍加速,且未牺牲几何保真度。
查看原文
查看缓存全文

缓存时间: 2026/08/25 08:35

论文页面 - Block3D:基于分块扩散的高效文本到3D生成

来源:https://huggingface.co/papers/2608.19567

摘要

Block3D 通过采用带置信度引导校正的分块扩散方法,在保持几何保真度的同时显著减少了推理时间,从而加速了文本到3D的生成过程。

尽管文本到3D生成(https://huggingface.co/papers?q=text-to-3D%20generation)技术发展迅速,但在低推理成本下实现高几何保真度仍然是一项挑战。现有的文本到3D方法要么自回归地解码离散形状标记(https://huggingface.co/papers?q=discrete%20shape%20tokens),要么通过扩散或流模型迭代优化全局3D表示。然而,自回归解码(https://huggingface.co/papers?q=autoregressive%20decoding)是顺序执行的,无法修正错误;而扩散和流匹配(https://huggingface.co/papers?q=flow-matching)模型则需要重复处理完整的表示,导致高质量生成的计算成本越来越高。本文提出了 Block3D,这是一个分块扩散(https://huggingface.co/papers?q=block-wise%20diffusion)框架。它将离散形状标记序列划分为连续的块,自回归地生成这些块,并对当前块内的所有标记进行联合去噪。为缓解误差累积,我们引入了置信度引导的块内校正(https://huggingface.co/papers?q=confidence-guided%20intra-block%20correction)机制,在每个块最终确定前修改低置信度的标记。在 TRELLIS-500K 的留出测试集上,Block3D 将平均端到端生成时间从 25.71 秒减少到 4.99 秒,在不牺牲几何保真度的情况下,比微调后的自回归基线实现了 5.15 倍的加速。

查看 arXiv 页面 (https://arxiv.org/abs/2608.19567) 查看 PDF (https://arxiv.org/pdf/2608.19567) 项目页面 (https://alexandertsui.github.io/block3d/) GitHub (https://github.com/ziplab/Block3D) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.19567)

通过你的代理获取本文:

hf papers read 2608.19567

还没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型0

尚无模型链接本文

在模型的 README.md 中引用 arxiv.org/abs/2608.19567 以从此页面链接到该模型。

引用本文的数据集0

尚无数据集链接本文

在数据集的 README.md 中引用 arxiv.org/abs/2608.19567 以从此页面链接到该数据集。

引用本文的 Space0

尚无 Space 链接本文

在 Space 的 README.md 中引用 arxiv.org/abs/2608.19567 以从此页面链接到该 Space。

包含本文的收藏集0

尚无收藏集包含本文

将本文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接到该收藏集。

相似文章

DiffusionGemma: 文本生成速度提升4倍

Hacker News Top

Google推出DiffusionGemma,这是一个实验性的26B MoE开源模型,通过文本扩散技术,在GPU上实现高达4倍的文本生成速度提升,针对速度要求高的交互式本地工作流。

Flash-BoN:扩散模型推理时扩展的即时草稿

Hugging Face Daily Papers

Flash-BoN 通过时间步截断、层跳过和激活代理生成廉价的草稿候选,然后使用多阶段验证选择最佳草稿进行完整细化,从而在固定挂钟预算下优于基线,提高文本到图像生成的效率。