ZipTok3D:使用紧凑标记前缀的高保真3D标记化
摘要
ZipTok3D是一种3D标记器,通过将几何形状组织成紧凑的全局标记前缀并使用迭代解码,从极短的标记序列中实现高保真重建,在标记长度显著减少的情况下优于基线方法。
查看缓存全文
缓存时间: 2026/09/03 11:52
论文页面 - ZipTok3D:基于紧凑令牌前缀的高保真3D令牌化
来源:https://huggingface.co/papers/2609.01740
摘要
ZipTok3D将3D几何结构组织成紧凑的全局令牌前缀,并通过迭代解码实现从极短令牌序列进行高保真重建。
紧凑的令牌序列对于高效的3D生成至关重要。然而,现有的3D令牌化器(https://huggingface.co/papers?q=3D%20tokenizer)通常将潜在表示组织在空间区域上或作为固定大小的全局令牌集合,当压缩到极低的令牌预算时,两者都会出现显著的重建质量下降。本文提出了ZipTok3D,这是一种专为从极短令牌序列进行高保真重建而设计的3D令牌化器(https://huggingface.co/papers?q=3D%20tokenizer)。其核心思想是将物体几何结构组织为渐进式信息丰富的全局令牌前缀(https://huggingface.co/papers?q=global-token%20prefixes),并通过迭代解码(https://huggingface.co/papers?q=iterative%20decoding)展开这些紧凑表示。具体而言,嵌套丢弃(https://huggingface.co/papers?q=nested%20dropout)在训练期间编码后随机截断潜在序列,并要求每个保留的前缀都能重建完整物体,从而将关键几何信息优先分配给前导令牌。解码器随后重复应用参数共享的Transformer(https://huggingface.co/papers?q=parameter-shared%20Transformer)块,从每个前缀中恢复细粒度几何结构,无需单独的生成采样阶段。在相同的令牌维度下,ZipTok3D在ShapeNet上仅用1个令牌、在TRELLIS上仅用4个令牌,就达到了与使用32个令牌的COD-VAE(https://huggingface.co/papers?q=COD-VAE)基线相当的重建质量,分别实现了32倍和8倍的令牌序列压缩。
查看arXiv页面(https://arxiv.org/abs/2609.01740)查看PDF(https://arxiv.org/pdf/2609.01740)项目页面(https://forthloth.github.io/ziptok3d/)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2609.01740)
在你的代理中获取此论文:
hf papers read 2609\.01740
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型0
无模型链接此论文
在模型README.md中引用arxiv.org/abs/2609.01740以从此页面链接它。
引用本文的数据集0
无数据集链接此论文
在数据集README.md中引用arxiv.org/abs/2609.01740以从此页面链接它。
引用本文的Spaces0
无Space链接此论文
在Space README.md中引用arxiv.org/abs/2609.01740以从此页面链接它。
包含本文的合集0
无合集包含此论文
将此论文添加到合集(https://huggingface.co/new-collection)以从此页面链接它。
相似文章
3DZip: 面向3D问答的空间感知特征多样性引导的令牌压缩
3DZip是一个面向3D视觉语言模型的三阶段令牌压缩框架,利用体素化、多样性引导的锚点选择和空间约束合并来减少令牌数量,同时保持空间推理能力。在3DQA基准上,仅使用128个令牌即可保留94.7%的原始性能,并实现1.92倍的推理加速。
quicktok: 一个更快的分词器(与tiktoken精确且字节一致)[P]
quicktok 是一个快速且精确的 BPE 分词器,用 C++ 编写,与 tiktoken 字节一致,比现有替代方案快 2–11 倍。支持 cl100k、o200k、GPT-OSS、Llama-3 和 Qwen2.5/3 编码器。
ztok —— 一个用 Zig 编写的高性能多线程分词器,支持加载 tiktoken / HF / SentencePiece,速度提升 2–5 倍
ztok 是一个用 Zig 编写的高性能多线程分词器库,支持多种格式(tiktoken、HF、SentencePiece 等),速度比现有方案快 2–5 倍,适用于 RAG 分块和数据集分词。
利用自引导标记化平衡图像压缩与生成
介绍了SelfBootTok,一种自引导标记化方法,它将全局和局部信息分离,使生成器计算量减少约40%,仅用64个标记即实现了1.56的gFID新最先进水平。
场景即对象,而非基元:来自无位姿视图的实例结构化3D令牌化
本文提出了一种前馈框架,能够从无位姿的多视图图像中将3D场景分解为实例结构的令牌组,从而在没有3D标注的情况下实现直接的对象级重建、分割和操控。