Imaginative Perception Tokens 增强多模态语言模型的空间推理能力
摘要
Imaginative Perception Tokens (IPT) 通过外化来自不同视角的中间感知表征,增强了视觉-语言模型的空间推理能力,在视角推理、路径追踪和多视角计数任务上优于传统的基于文本的推理。
查看缓存全文
缓存时间: 2026/06/08 19:17
论文页面 - 想象感知标记提升多模态语言模型的空间推理能力
来源:https://huggingface.co/papers/2606.03988 作者:
,
,
,
,
,
,
,
,
,
摘要
Imaginative Perception Tokens(IPT)通过提供中间感知表示,外化模型从替代视角感知到的内容,从而增强视觉语言模型的空间推理能力,其表现优于传统基于文本的推理方法。
视觉语言模型(https://huggingface.co/papers?q=Vision%20language%20models)(VLM)在许多任务中表现出色,但当关键信息无法直接观察时,它们仍然难以应对空间推理(https://huggingface.co/papers?q=spatial%20reasoning)任务。许多此类问题需要想象感知(https://huggingface.co/papers?q=imaginative%20perception):推断从未见视角看到的内容、追踪穿过遮挡空间的路径,或将零散观察整合为连贯的空间表示。我们引入Imaginative Perception Tokens(https://huggingface.co/papers?q=Imaginative%20Perception%20Tokens)(IPT),这是一种中间感知表示,外化了VLM在替代空间配置下会感知到的内容,同时与观察到的输入保持一致。为研究这一能力,我们设计了三个任务:Perspective Taking(https://huggingface.co/papers?q=Perspective%20Taking)(PET)、Path Tracing(https://huggingface.co/papers?q=Path%20Tracing)(PT)和Multiview Counting(https://huggingface.co/papers?q=Multiview%20Counting)(MVC),并构建了约20K样本的数据集,包含真实想象、答案和评估基准。使用统一VLM骨架BAGEL(https://huggingface.co/papers?q=BAGEL)后,IPT监督(https://huggingface.co/papers?q=supervision)持续提升空间推理(https://huggingface.co/papers?q=spatial%20reasoning)能力,且通常优于文本思维链训练,即使在推理时不生成图像也是如此。在MVC上,IPT将准确率提升3.4%,并在PT上达到与强封闭源模型相竞争的性能。我们进一步发现,结合IPT与仅标签监督(https://huggingface.co/papers?q=supervision)可带来额外收益,而文本思维链则可能大幅降低性能,这表明当空间计算被迫通过语言进行时存在模态不匹配。总体而言,IPT为推理未观测到的空间结构提供了原则性的监督(https://huggingface.co/papers?q=supervision)信号,提升了泛化(https://huggingface.co/papers?q=generalization)能力,同时生成了可解释的中间表示(https://huggingface.co/papers?q=intermediate%20representations)。
查看arXiv页面(https://arxiv.org/abs/2606.03988)查看PDF(https://arxiv.org/pdf/2606.03988)项目页面(https://mahtabbigverdi.github.io/Imaginative-tokens.github.io/)GitHub2(https://github.com/weikaih04/Imaginative-Perception-Token)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.03988)
在您的智能体中获取此论文:
hf papers read 2606\.03988
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2606.03988 即可从此页面链接。
引用此论文的数据集13
weikaih/imaginative-perception-token-pet-ipt 查看器•更新于30分钟前 • 20.5k • 971 • 1 (https://huggingface.co/datasets/weikaih/imaginative-perception-token-pet-ipt)
weikaih/imaginative-perception-token-mvc-ipt 查看器•更新于30分钟前 • 20k • 577 • 1 (https://huggingface.co/datasets/weikaih/imaginative-perception-token-mvc-ipt)
weikaih/imaginative-perception-token-pet-eval-ai2thor 查看器•更新于30分钟前 • 278 • 51 (https://huggingface.co/datasets/weikaih/imaginative-perception-token-pet-eval-ai2thor)
weikaih/imaginative-perception-token-pet-answeronly 查看器•更新于30分钟前 • 20.5k • 42 (https://huggingface.co/datasets/weikaih/imaginative-perception-token-pet-answeronly)
浏览引用此论文的13个数据集 (https://huggingface.co/datasets?other=arxiv:2606.03988)### 引用此论文的空间0
没有空间链接此论文
在空间 README.md 中引用 arxiv.org/abs/2606.03988 即可从此页面链接。
包含此论文的收藏2
相似文章
用想象力思考:基于世界模拟器的主动式视觉空间推理
本文提出了Astra,一个主动式空间推理框架,将经过强化学习训练的VLM策略与一个世界模拟器结合起来,生成新视角的观察结果,以改进视觉语言模型中的空间推理能力。
检索、整合与综合:空间-语义接地潜层视觉推理
本文介绍了 RIS,这是一个用于多模态大语言模型的空间-语义接地潜层视觉推理框架,旨在克服信息瓶颈。该框架提出将潜在令牌(tokens)锚定于空间和语义证据之上,在 V* 和 HRBench 等基准测试中展现出性能提升。
看不清还是想不对?面向视觉语言推理的感知奖励
本文提出一种强化学习框架,通过显式奖励感知保真度来改善视觉语言模型中的感知-推理协同,利用“蒙眼推理”代理和结构化言语验证来解决模态信用分配中的模糊性。
光学推理:重新审视图像作为超越文本的表达性推理媒介
提出光学推理,将图像作为语言和多模态任务的独立推理媒介,相比传统基于文本的方法实现了更高的令牌效率。
视觉的代价:在单一范式中实现可信的多模态推理
本文挑战了当前视觉语言模型忠实地融合多模态数据的假设,提出了一种基于信息论的 Modality Translation Protocol,并引入了新指标(Toll、Curse、Fallacy of Seeing)来评估可信度,而非传统的多模态增益。