3DZip: 面向3D问答的空间感知特征多样性引导的令牌压缩

Hugging Face Daily Papers 论文

摘要

3DZip是一个面向3D视觉语言模型的三阶段令牌压缩框架,利用体素化、多样性引导的锚点选择和空间约束合并来减少令牌数量,同时保持空间推理能力。在3DQA基准上,仅使用128个令牌即可保留94.7%的原始性能,并实现1.92倍的推理加速。

最近的3D视觉语言模型(3D VLMs)通过将2D视觉特征投影到世界坐标来构建几何感知令牌,从而为3D问答等任务提供空间推理能力。然而,这种设计为每个场景生成数千个令牌,导致大量的计算和内存开销。尽管令牌压缩在2D VLM中已被广泛研究,但现有方法依赖于语义相关性或基于注意力的选择,忽视了3D令牌的结构化空间特性。此外,仅靠空间邻近性无法解决3D表示中的冗余,因为在空间聚合之后,对象级令牌不平衡仍然存在。为了解决这一问题,我们提出了3DZip,这是一个三阶段令牌压缩框架:首先应用粗粒度体素化去除点级冗余,然后通过行列式点过程基于特征空间多样性选择锚点令牌,最后在空间约束下合并剩余令牌以保持几何一致性。在三个3D问答基准上的实验表明,3DZip始终优于现有压缩方法,仅使用128个令牌即可保留94.7%的原始性能,实现1.92倍的推理加速。
查看原文
查看缓存全文

缓存时间: 2026/08/04 09:38

论文页面 - 3DZip:面向3D问答的空间感知特征多样性引导的令牌压缩

来源:https://huggingface.co/papers/2608.01185

摘要

最近的3D视觉-语言模型(3DVLMs)通过将2D视觉特征投影到世界坐标来构建几何感知令牌,从而支持3D问答等任务的空间推理。然而,这种设计每个场景会生成数千个令牌,导致巨大的计算和内存开销。虽然令牌压缩在2DVLMs中已被广泛研究,但现有方法依赖于语义相关性或基于注意力的选择,忽略了3D令牌的结构化空间特性。此外,3D表示中的冗余无法仅通过空间邻近性来解决,因为即使在空间聚合之后,对象级别的令牌不平衡仍然存在。为了解决这个问题,我们提出了3DZip,一个三阶段的令牌压缩框架,首先应用粗体素化去除点级冗余,然后通过行列式点过程基于特征空间多样性选择锚定令牌,最后在空间约束下合并剩余令牌以保持几何一致性。在三个3D问答基准上的实验表明,3DZip持续优于现有的压缩方法,仅用128个令牌即可保留94.7%的原始性能,并实现了1.92倍的推理速度提升。

查看arXiv页面 (https://arxiv.org/abs/2608.01185) 查看PDF (https://arxiv.org/pdf/2608.01185) 项目页面 (https://paper.pnu-cvsp.com/3DZip/) GitHub13 (https://github.com/cvsp-lab/3DZip) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.01185)

在你的代理中获取这篇论文:

hf papers read 2608\.01185

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接此论文

在模型README.md中引用arxiv.org/abs/2608.01185以从此页面链接它。

引用此论文的数据集0

没有数据集链接此论文

在数据集README.md中引用arxiv.org/abs/2608.01185以从此页面链接它。

引用此论文的Space0

没有Space链接此论文

在Space README.md中引用arxiv.org/abs/2608.01185以从此页面链接它。

包含此论文的收藏集0

没有收藏集包含此论文

将这篇论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接它。

相似文章

OmniScope:全模态大语言模型的模态解耦令牌压缩

Hugging Face Daily Papers

OmniScope是一个面向全模态大语言模型的无训练令牌压缩框架,它使用查询作为共享锚点,分别评估音频和视频的相关性,实现了高达3.53倍的预填充加速和超过15%的GPU内存减少,且精度损失极小。