用想象力思考:基于世界模拟器的主动式视觉空间推理

Hugging Face Daily Papers 论文

摘要

本文提出了Astra,一个主动式空间推理框架,将经过强化学习训练的VLM策略与一个世界模拟器结合起来,生成新视角的观察结果,以改进视觉语言模型中的空间推理能力。

尽管视觉语言模型(VLM)已经展现出强大的视觉推理能力,但其空间推理能力在很大程度上仍然局限于观察到的图像和基于文本的思维链。当只有有限的自我中心观察可用时,它们通常难以推断未观察到的布局、保持跨视角的一致性以及从替代视角进行推理。在这项工作中,我们将这个问题视为用想象力思考,即VLM在推理过程中通过与世界模拟器交互来主动获取想象中的视觉证据。我们提出了Astra,一个主动式空间推理框架,赋予VLM基于动作条件的视觉想象能力。具体来说,Astra将经过强化学习训练的VLM策略Astra-VL与基于Bagel的世界模拟器Astra-WM相结合,后者能够从上下文图像和自然语言描述的相机运动生成新视角的观察结果。为了提供可靠的想象证据,Astra-WM通过视角一致性调优进行训练,以提升跨视角的姿态和内容一致性。在强化学习阶段,我们提出了一种包含世界模拟器在回路中的两阶段强化学习课程,以稳定工具使用的探索,并提升模型仅在想象观察比直接回答更有益时调用模拟器的能力。实验表明,世界模拟器和主动式策略都是必要的:Astra-WM将模拟器增强的Gemini-3-Flash在MMSI-Bench上的表现从45.1提升到49.5,而Astra-VL将Qwen3-VL骨干模型在MMSI-Bench上的成绩从29.8提升到38.8,在MindCube上从36.8提升到42.7。这些结果表明,想象观察可以提供有用的空间证据,但有效的世界模型增强推理需要学习何时、何地以及如何想象。
查看原文
查看缓存全文

缓存时间: 2026/06/08 07:14

论文页面 - 用想象力思考:基于世界模拟器的智能体视觉空间推理

来源: https://huggingface.co/papers/2606.06476

摘要

Astra 是一个智能体空间推理框架,通过将强化学习训练的策略与用于生成新视角观察的世界模拟器相结合,用动作条件视觉想象增强视觉语言模型。

尽管视觉语言模型显示出强大的视觉推理能力,但其空间推理能力在很大程度上仍局限于观察到的图像和面向文本的思维链。当只有有限的自我中心观察可用时,它们常常难以推断未观察到的布局、保持跨视图一致性以及从替代视角进行推理。在这项工作中,我们将该问题作为“用想象力思考”来研究,其中 VLM 在推理过程中通过与世界模拟器交互来主动获取想象的视觉证据。我们提出 Astra,这是一个智能体空间推理框架,赋予 VLM 动作条件视觉想象能力。具体来说,Astra 将 Astra-VL(一个经过强化学习训练的 VLM 策略)与 Astra-WM(一个基于 Bagel 的世界模拟器)相结合,该模拟器能从上下文图像和自然语言相机运动生成新视角观察。为了提供可靠的想象证据,Astra-WM 通过视图一致性微调进行训练,以提高跨视图的姿态和内容一致性。在强化学习阶段,我们提出了一种世界模拟器在环的两阶段强化学习课程,以稳定工具使用探索,并提升模型仅在想象观察优于直接回答时调用模拟器的能力。实验证明,世界模拟器和智能体策略都是必要的:Astra-WM 将模拟器增强的 Gemini-3-Flash 在 MMSI-Bench 上的结果从 45.1 提升到 49.5,而 Astra-VL 将 Qwen3-VL 骨干网络在 MMSI-Bench 上从 29.8 提升到 38.8,在 MindCube 上从 36.8 提升到 42.7。这些结果表明,想象的观察可以提供有用的空间证据,但有效的世界模型增强推理需要学习何时、何地以及如何想象。

查看 arXiv 页面 (https://arxiv.org/abs/2606.06476)查看 PDF (https://arxiv.org/pdf/2606.06476)项目页面 (https://zcmax.github.io/projects/Thinking-With-Imagination/)GitHub10 (https://github.com/ZCMax/Thinking-With-Imagination)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.06476)

在你的智能体中获取这篇论文:

hf papers read 2606.06476

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有链接此论文的模型

在模型 README.md 中引用 arxiv.org/abs/2606.06476 即可在此页面链接它。

引用此论文的数据集0

没有链接此论文的数据集

在数据集 README.md 中引用 arxiv.org/abs/2606.06476 即可在此页面链接它。

引用此论文的 Spaces0

没有链接此论文的 Space

在 Space README.md 中引用 arxiv.org/abs/2606.06476 即可在此页面链接它。

包含此论文的收藏0

没有包含此论文的收藏

将此论文添加到收藏即可从本页链接。

相似文章

SpatialAct: 探索VLM智能体在3D场景中的空间推理到行动的能力

Hugging Face Daily Papers

SpatialAct是一个新的基于模拟器的基准,用于探索VLM智能体是否能在多轮反馈设置下进行连贯的空间推理并将其转化为3D环境中的行动。实验揭示了一个显著的推理到行动差距:当前的VLM尽管在孤立推理任务上表现良好,但难以维持空间信念并产生可靠的行为。

强化空间视觉语言模型中的双路径推理

Hugging Face Daily Papers

本文介绍了SR-REAL,一个统一的空间视觉语言模型框架,通过强化学习结合了语言推理和三维几何推理,使得模型能够在多种任务中实现稳健的多步空间推理。

视觉思考-视觉-语言-行动策略:视觉中间推理实现高效低延迟

Hugging Face Daily Papers

视觉思考-视觉-语言-行动策略(VisualThink-VLA)引入了一种用于视觉-语言-行动策略的视觉中间推理框架,该框架保留了空间精度,并相比基于文本的推理显著降低了延迟,在机器人操作基准测试中实现了亚秒级推理和领先的成功率。