Imaginative Perception Tokens 增强多模态语言模型的空间推理能力

Hugging Face Daily Papers 论文

摘要

Imaginative Perception Tokens (IPT) 通过外化来自不同视角的中间感知表征,增强了视觉-语言模型的空间推理能力,在视角推理、路径追踪和多视角计数任务上优于传统的基于文本的推理。

视觉语言模型(VLM)在许多任务上表现出色,但当关键信息不可直接观察时,它们在空间推理方面仍然存在困难。许多此类问题需要想象力感知:推断从未见视角会看到什么,追踪穿过遮挡空间的路径,或将部分观察整合为连贯的空间表征。我们引入了 Imaginative Perception Tokens (IPT),这是一种中间感知表征,它外化了 VLM 在替代空间配置下会感知到的内容,同时保持与观察输入的一致性。 为了研究这一能力,我们设计了三个任务:视角推理(PET)、路径追踪(PT)和多视角计数(MVC),并构建了约 20K 个样本的数据集,包含真实想象力、答案和评估基准。使用统一的 VLM BAGEL 作为骨干模型,IPT 监督持续改善了空间推理,且通常在推理时无需生成图像即可优于文本思维链训练。在 MVC 上,IPT 将准确率提高了 3.4%,并在 PT 上达到了与强大闭源模型竞争的性能。我们进一步发现,将 IPT 与仅标签监督相结合可获得额外收益,而文本思维链可能显著降低性能,这表明当空间计算被迫通过语言进行时存在模态不匹配。总体而言,IPT 为推理未观察到的空间结构提供了有原则的监督信号,提高了泛化能力,同时生成了可解释的中间表征。
查看原文
查看缓存全文

缓存时间: 2026/06/08 19:17

论文页面 - 想象感知标记提升多模态语言模型的空间推理能力

来源:https://huggingface.co/papers/2606.03988 作者:

,

,

,

,

,

,

,

,

,

摘要

Imaginative Perception Tokens(IPT)通过提供中间感知表示,外化模型从替代视角感知到的内容,从而增强视觉语言模型的空间推理能力,其表现优于传统基于文本的推理方法。

视觉语言模型(https://huggingface.co/papers?q=Vision%20language%20models)(VLM)在许多任务中表现出色,但当关键信息无法直接观察时,它们仍然难以应对空间推理(https://huggingface.co/papers?q=spatial%20reasoning)任务。许多此类问题需要想象感知(https://huggingface.co/papers?q=imaginative%20perception):推断从未见视角看到的内容、追踪穿过遮挡空间的路径,或将零散观察整合为连贯的空间表示。我们引入Imaginative Perception Tokens(https://huggingface.co/papers?q=Imaginative%20Perception%20Tokens)(IPT),这是一种中间感知表示,外化了VLM在替代空间配置下会感知到的内容,同时与观察到的输入保持一致。为研究这一能力,我们设计了三个任务:Perspective Taking(https://huggingface.co/papers?q=Perspective%20Taking)(PET)、Path Tracing(https://huggingface.co/papers?q=Path%20Tracing)(PT)和Multiview Counting(https://huggingface.co/papers?q=Multiview%20Counting)(MVC),并构建了约20K样本的数据集,包含真实想象、答案和评估基准。使用统一VLM骨架BAGEL(https://huggingface.co/papers?q=BAGEL)后,IPT监督(https://huggingface.co/papers?q=supervision)持续提升空间推理(https://huggingface.co/papers?q=spatial%20reasoning)能力,且通常优于文本思维链训练,即使在推理时不生成图像也是如此。在MVC上,IPT将准确率提升3.4%,并在PT上达到与强封闭源模型相竞争的性能。我们进一步发现,结合IPT与仅标签监督(https://huggingface.co/papers?q=supervision)可带来额外收益,而文本思维链则可能大幅降低性能,这表明当空间计算被迫通过语言进行时存在模态不匹配。总体而言,IPT为推理未观测到的空间结构提供了原则性的监督(https://huggingface.co/papers?q=supervision)信号,提升了泛化(https://huggingface.co/papers?q=generalization)能力,同时生成了可解释的中间表示(https://huggingface.co/papers?q=intermediate%20representations)。

查看arXiv页面(https://arxiv.org/abs/2606.03988)查看PDF(https://arxiv.org/pdf/2606.03988)项目页面(https://mahtabbigverdi.github.io/Imaginative-tokens.github.io/)GitHub2(https://github.com/weikaih04/Imaginative-Perception-Token)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.03988)

在您的智能体中获取此论文:

hf papers read 2606\.03988

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2606.03988 即可从此页面链接。

引用此论文的数据集13

weikaih/imaginative-perception-token-pet-ipt 查看器•更新于30分钟前 • 20.5k • 971 • 1 (https://huggingface.co/datasets/weikaih/imaginative-perception-token-pet-ipt)

weikaih/imaginative-perception-token-mvc-ipt 查看器•更新于30分钟前 • 20k • 577 • 1 (https://huggingface.co/datasets/weikaih/imaginative-perception-token-mvc-ipt)

weikaih/imaginative-perception-token-pet-eval-ai2thor 查看器•更新于30分钟前 • 278 • 51 (https://huggingface.co/datasets/weikaih/imaginative-perception-token-pet-eval-ai2thor)

weikaih/imaginative-perception-token-pet-answeronly 查看器•更新于30分钟前 • 20.5k • 42 (https://huggingface.co/datasets/weikaih/imaginative-perception-token-pet-answeronly)

浏览引用此论文的13个数据集 (https://huggingface.co/datasets?other=arxiv:2606.03988)### 引用此论文的空间0

没有空间链接此论文

在空间 README.md 中引用 arxiv.org/abs/2606.03988 即可从此页面链接。

包含此论文的收藏2

相似文章

检索、整合与综合:空间-语义接地潜层视觉推理

arXiv cs.CL

本文介绍了 RIS,这是一个用于多模态大语言模型的空间-语义接地潜层视觉推理框架,旨在克服信息瓶颈。该框架提出将潜在令牌(tokens)锚定于空间和语义证据之上,在 V* 和 HRBench 等基准测试中展现出性能提升。

视觉的代价:在单一范式中实现可信的多模态推理

Hugging Face Daily Papers

本文挑战了当前视觉语言模型忠实地融合多模态数据的假设,提出了一种基于信息论的 Modality Translation Protocol,并引入了新指标(Toll、Curse、Fallacy of Seeing)来评估可信度,而非传统的多模态增益。