3DZip: 面向3D问答的空间感知特征多样性引导的令牌压缩
摘要
3DZip是一个面向3D视觉语言模型的三阶段令牌压缩框架,利用体素化、多样性引导的锚点选择和空间约束合并来减少令牌数量,同时保持空间推理能力。在3DQA基准上,仅使用128个令牌即可保留94.7%的原始性能,并实现1.92倍的推理加速。
查看缓存全文
缓存时间: 2026/08/04 09:38
论文页面 - 3DZip:面向3D问答的空间感知特征多样性引导的令牌压缩
来源:https://huggingface.co/papers/2608.01185
摘要
最近的3D视觉-语言模型(3DVLMs)通过将2D视觉特征投影到世界坐标来构建几何感知令牌,从而支持3D问答等任务的空间推理。然而,这种设计每个场景会生成数千个令牌,导致巨大的计算和内存开销。虽然令牌压缩在2DVLMs中已被广泛研究,但现有方法依赖于语义相关性或基于注意力的选择,忽略了3D令牌的结构化空间特性。此外,3D表示中的冗余无法仅通过空间邻近性来解决,因为即使在空间聚合之后,对象级别的令牌不平衡仍然存在。为了解决这个问题,我们提出了3DZip,一个三阶段的令牌压缩框架,首先应用粗体素化去除点级冗余,然后通过行列式点过程基于特征空间多样性选择锚定令牌,最后在空间约束下合并剩余令牌以保持几何一致性。在三个3D问答基准上的实验表明,3DZip持续优于现有的压缩方法,仅用128个令牌即可保留94.7%的原始性能,并实现了1.92倍的推理速度提升。
查看arXiv页面 (https://arxiv.org/abs/2608.01185) 查看PDF (https://arxiv.org/pdf/2608.01185) 项目页面 (https://paper.pnu-cvsp.com/3DZip/) GitHub13 (https://github.com/cvsp-lab/3DZip) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.01185)
在你的代理中获取这篇论文:
hf papers read 2608\.01185
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
在模型README.md中引用arxiv.org/abs/2608.01185以从此页面链接它。
引用此论文的数据集0
没有数据集链接此论文
在数据集README.md中引用arxiv.org/abs/2608.01185以从此页面链接它。
引用此论文的Space0
没有Space链接此论文
在Space README.md中引用arxiv.org/abs/2608.01185以从此页面链接它。
包含此论文的收藏集0
没有收藏集包含此论文
将这篇论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接它。
相似文章
超越3D VQA:将3D空间先验注入视觉语言模型以增强几何推理
本文提出GASP框架,通过深度监督结合对比损失和深度一致性损失将几何先验注入视觉语言模型,在3D空间推理基准上取得了显著提升,且无需使用3D VQA数据。
每个多模态证据一个Token:面向资源受限问答的Latent Memory
潜在记忆(Latent Memory)引入了一种用于问答中外部记忆的压缩表示方法,在减少Token消耗和存储需求的同时,在纯文本和多模态基准测试中保持有竞争力的表现。
基于视觉基础模型引导的注意力一致性纵向医学视觉问答
提出了一种用于纵向医学视觉问答的注意力引导编码器-解码器,使用冻结的基于DINO的掩码生成器和辅助损失函数来提高一致性和可解释性,在Medical-Diff-VQA基准上取得了强劲的结果。
OmniScope:全模态大语言模型的模态解耦令牌压缩
OmniScope是一个面向全模态大语言模型的无训练令牌压缩框架,它使用查询作为共享锚点,分别评估音频和视频的相关性,实现了高达3.53倍的预填充加速和超过15%的GPU内存减少,且精度损失极小。
@jiqizhixin: 如果你的AI能像流媒体编解码器一样“看”视频——只把令牌花在最关键的时刻?介绍……
LLaVA-OneVision-2 引入了编解码流令牌化技术以实现高效的视频理解,在时间与空间基准测试上显著超越 Qwen3-VL-8B。模型、数据和代码均已开源。