ZipTok3D:使用紧凑标记前缀的高保真3D标记化

Hugging Face Daily Papers 论文

摘要

ZipTok3D是一种3D标记器,通过将几何形状组织成紧凑的全局标记前缀并使用迭代解码,从极短的标记序列中实现高保真重建,在标记长度显著减少的情况下优于基线方法。

紧凑的标记序列对于高效的3D生成至关重要。然而,现有的3D标记器通常将潜在表示组织为空间区域上的或固定大小的全局标记集合,当压缩到极低标记预算时,两者都会出现严重的重建质量下降。本文提出ZipTok3D,一种专为从极短标记序列实现高保真重建而设计的3D标记器。其核心思想是将物体几何形状组织成渐进信息丰富的全局标记前缀,并通过迭代解码展开这些紧凑表示。具体而言,在训练过程中,嵌套随机丢弃在编码后随机截断潜在序列,并要求每个保留的前缀重建完整物体,从而优先将基本几何信息置于前导标记中。解码器随后重复应用参数共享的Transformer块,从每个前缀中恢复细粒度几何形状,无需单独的生成采样阶段。在相同标记维度下,ZipTok3D在ShapeNet上仅使用一个标记,在TRELLIS上使用四个标记,达到了与32标记的COD-VAE基线相当的重建质量,分别实现了32倍和8倍的标记序列缩短。
查看原文
查看缓存全文

缓存时间: 2026/09/03 11:52

论文页面 - ZipTok3D:基于紧凑令牌前缀的高保真3D令牌化

来源:https://huggingface.co/papers/2609.01740

摘要

ZipTok3D将3D几何结构组织成紧凑的全局令牌前缀,并通过迭代解码实现从极短令牌序列进行高保真重建。

紧凑的令牌序列对于高效的3D生成至关重要。然而,现有的3D令牌化器(https://huggingface.co/papers?q=3D%20tokenizer)通常将潜在表示组织在空间区域上或作为固定大小的全局令牌集合,当压缩到极低的令牌预算时,两者都会出现显著的重建质量下降。本文提出了ZipTok3D,这是一种专为从极短令牌序列进行高保真重建而设计的3D令牌化器(https://huggingface.co/papers?q=3D%20tokenizer)。其核心思想是将物体几何结构组织为渐进式信息丰富的全局令牌前缀(https://huggingface.co/papers?q=global-token%20prefixes),并通过迭代解码(https://huggingface.co/papers?q=iterative%20decoding)展开这些紧凑表示。具体而言,嵌套丢弃(https://huggingface.co/papers?q=nested%20dropout)在训练期间编码后随机截断潜在序列,并要求每个保留的前缀都能重建完整物体,从而将关键几何信息优先分配给前导令牌。解码器随后重复应用参数共享的Transformer(https://huggingface.co/papers?q=parameter-shared%20Transformer)块,从每个前缀中恢复细粒度几何结构,无需单独的生成采样阶段。在相同的令牌维度下,ZipTok3D在ShapeNet上仅用1个令牌、在TRELLIS上仅用4个令牌,就达到了与使用32个令牌的COD-VAE(https://huggingface.co/papers?q=COD-VAE)基线相当的重建质量,分别实现了32倍和8倍的令牌序列压缩。

查看arXiv页面(https://arxiv.org/abs/2609.01740)查看PDF(https://arxiv.org/pdf/2609.01740)项目页面(https://forthloth.github.io/ziptok3d/)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2609.01740)

在你的代理中获取此论文:

hf papers read 2609\.01740

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型0

无模型链接此论文

在模型README.md中引用arxiv.org/abs/2609.01740以从此页面链接它。

引用本文的数据集0

无数据集链接此论文

在数据集README.md中引用arxiv.org/abs/2609.01740以从此页面链接它。

引用本文的Spaces0

无Space链接此论文

在Space README.md中引用arxiv.org/abs/2609.01740以从此页面链接它。

包含本文的合集0

无合集包含此论文

将此论文添加到合集(https://huggingface.co/new-collection)以从此页面链接它。

相似文章

3DZip: 面向3D问答的空间感知特征多样性引导的令牌压缩

Hugging Face Daily Papers

3DZip是一个面向3D视觉语言模型的三阶段令牌压缩框架,利用体素化、多样性引导的锚点选择和空间约束合并来减少令牌数量,同时保持空间推理能力。在3DQA基准上,仅使用128个令牌即可保留94.7%的原始性能,并实现1.92倍的推理加速。

利用自引导标记化平衡图像压缩与生成

arXiv cs.LG

介绍了SelfBootTok,一种自引导标记化方法,它将全局和局部信息分离,使生成器计算量减少约40%,仅用64个标记即实现了1.56的gFID新最先进水平。