软空间推理(Soft Spatial Reasoning)

Hugging Face Daily Papers 论文

摘要

本文提出 Soft Spatial Reasoning,一个针对大型视觉-语言模型(LVLM)空间任务的后训练框架,其引入自适应的"软思考"机制:在中间推理步骤中混合 token 嵌入,而非直接选定某个离散 token。AdaptSoft 控制器会根据隐藏状态与预测不确定性动态调整软化程度,在多个空间推理基准上超越了硬思考(hard)与固定软化程度的 CoT 基线。

大型视觉-语言模型(LVLM)通常通过思维链(chain-of-thought, CoT)完成空间推理,将中间推理过程编码为离散语言 token 的自回归序列。这种硬思考(hard thinking)方式要求模型在每一步都选定单一 token,即使此时正确的空间解读仍存在不确定性。这种过早的决策会构成过早离散化(premature discretization):错误的 token 选择会在后续推理中不断传播并放大错误。我们提出 Soft Spatial Reasoning,一个面向 LVLM 空间任务、引入软思考(soft thinking)机制的后训练框架。在每一个中间推理步骤中,LVLM 通过混合 token 嵌入而非选定单一 token,形成一个连续的软状态(soft state),从而让多个候选延续方案共同影响下一步推理。然而,合适的软化程度在不同推理步骤之间可能存在差异:保留多个候选方案可能有助于保留有用的空间解读,但如果这些候选方案所蕴含的空间关系相互矛盾,混合它们反而会干扰后续推理。Soft Spatial Reasoning 的核心是 AdaptSoft——一个利用当前隐藏状态与预测不确定性、在每个推理步骤动态调整软化程度的控制器。为训练 AdaptSoft,我们提出梯度对齐学习目标(gradient-alignment learning objective),在无需中间推理监督信号的情况下,为软化程度控制提供逐步骤的学习信号。在多个多样的空间推理基准上,使用相同主干模型时,Soft Spatial Reasoning 均优于硬思考与固定软化程度的 CoT 基线,同时也优于一系列现有的 LVLM。源代码已发布于 https://github.com/rafiibnsultan/Soft_Spatial_Reasoning
查看原文
查看缓存全文

缓存时间: 2026/10/01 16:23

论文页面 - Soft Spatial Reasoning(软空间推理)

来源:https://huggingface.co/papers/2609.38717

摘要

大型视觉语言模型(LVLMs)通常通过思维链(CoT)进行空间推理,将中间推理过程编码为离散语言 token 的自回归序列。这种“硬思考“要求模型在每一步都锁定于单个 token,即使正确的空间解读仍然存在不确定性。这种过早的决策构成了“过早离散化“:错误的 token 选择会使误差在后续推理中不断传播。我们提出了 Soft Spatial Reasoning,一个为 LVLM 中的空间任务引入“软思考“的后训练框架。在每个中间推理步骤中,LVLM 通过混合 token 嵌入来形成连续的软状态,而不是选择单个 token,从而允许多个候选续接路径共同影响下一步。然而,合适的软化程度在不同推理步骤间可能有所不同:保留多个候选可能有助于维持有价值的空间解读,但如果这些候选隐含着相互冲突的空间关系,混合它们反而可能干扰后续推理。Soft Spatial Reasoning 的核心是 AdaptSoft——一个利用当前隐藏状态和预测不确定性来在每一步自适应调整软化程度的控制器。为了训练 AdaptSoft,我们引入了梯度对齐学习目标,该目标在无需中间推理监督的情况下,为软化程度控制提供逐步骤的学习信号。在多种空间基准测试上,使用相同骨干模型时,Soft Spatial Reasoning 的表现优于硬思考和固定软化程度的 CoT 基线方法,也优于一系列现有的 LVLM。源代码见:https://github.com/rafiibnsultan/Soft_Spatial_Reasoning

查看 arXiv 页面 (https://arxiv.org/abs/2609.38717)|查看 PDF (https://arxiv.org/pdf/2609.38717)|GitHub 0 (https://github.com/rafiibnsultan/Soft_Spatial_Reasoning)|添加到合集 (https://huggingface.co/login?next=%2Fpapers%2F2609.38717)

在你的智能体中获取此论文:

hf papers read 2609\.38717

还没有最新版 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

没有模型关联到此论文

在模型的 README.md 中引用 arxiv.org/abs/2609.38717,即可从本页面链接它。

引用此论文的数据集 0

没有数据集关联到此论文

在数据集的 README.md 中引用 arxiv.org/abs/2609.38717,即可从本页面链接它。

引用此论文的 Spaces 0

没有 Space 关联到此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2609.38717,即可从本页面链接它。

包含此论文的合集 0

没有合集包含此论文

将此论文添加到合集 (https://huggingface.co/new-collection) 以从本页面链接它。

相似文章

强化空间视觉语言模型中的双路径推理

Hugging Face Daily Papers

本文介绍了SR-REAL,一个统一的空间视觉语言模型框架,通过强化学习结合了语言推理和三维几何推理,使得模型能够在多种任务中实现稳健的多步空间推理。

SVoT: 基于强化学习的状态感知思维可视化空间推理

arXiv cs.AI

论文提出了SVoT,一种用于多模态大语言模型(MLLMs)中多跳空间推理的强化学习框架,该框架生成交错、可验证的中间状态和可视化,在涉及多对象交互和数值推理的新基准测试上取得了显著的准确性提升。

检索、整合与综合:空间-语义接地潜层视觉推理

arXiv cs.CL

本文介绍了 RIS,这是一个用于多模态大语言模型的空间-语义接地潜层视觉推理框架,旨在克服信息瓶颈。该框架提出将潜在令牌(tokens)锚定于空间和语义证据之上,在 V* 和 HRBench 等基准测试中展现出性能提升。