展开世界:在强化空间推理中因子化4D属性

Hugging Face Daily Papers 论文

摘要

本文介绍了FactoSR,一个因子化强化学习框架,通过将4D属性分解为正交子目标,增强了视觉-语言模型的空间推理能力,在多视角和视频基准测试中取得了显著的性能提升。

尽管视觉-语言模型(VLMs)在一般多模态任务中表现出色,但在推理物理世界时,它们本质上仍然是“扁平”的。我们认为这一空间瓶颈源于深刻的维度不匹配:虽然VLMs被训练来解释二维投影,但真正的空间推理要求恢复潜在的三维几何和时间连续性。为了克服这种高维复杂性,我们主张从整体学习转向“分而治之”的范式。我们提出了FactoSR,一个因子化强化学习框架,它明确解释了被视觉投影折叠的维度。在核心上,FactoSR将世界一致性推理的整体问题分解为三个正交的几何子目标:平面对应(XY)、深度一致性(Z)和时间可逆性(T)。通过在统一的策略学习机制中优化这些可验证的约束,我们有效地将一个病态的投影恢复问题转化为一系列可操作的推理步骤。在多视角和视频基准测试上的广泛评估表明,这种优雅的分解在3D和4D推理中产生了显著的增益,在VSI-Bench上实现了5.9%的提升,在All-Angles-Bench上实现了4.5%的提升。我们的研究结果表明,强化显式、因子化的4D一致性是将VLMs演变为健壮的世界感知推理器的关键一步。
查看原文

相似文章

强化空间视觉语言模型中的双路径推理

Hugging Face Daily Papers

本文介绍了SR-REAL,一个统一的空间视觉语言模型框架,通过强化学习结合了语言推理和三维几何推理,使得模型能够在多种任务中实现稳健的多步空间推理。

4DThinker:利用 4D 意象进行动态空间理解

Hugging Face Daily Papers

4DThinker 是一个新框架,使视觉-语言模型能够利用 4D 潜在心理意象执行动态空间推理。该论文引入了可扩展的数据生成方法以及新颖的微调技术(包括 4D 强化学习),以提升模型在复杂动态任务上的性能。

将3D建模与空间推理解耦

arXiv cs.LG

本文提出DiSR,一个将3D感知与推理分离的框架,利用现成的感知模型重建显式3D证据,并通过LoRA微调LLM进行空间推理,在提升可解释性和效率的同时取得了具有竞争力的性能。

强化学习中的分解频谱表示

arXiv cs.LG

本文提出FaStR,一种通过CP分解将强化学习中的转移核分解为独立的状态、动作和下一状态编码器的方法,从而提升样本效率,尤其在高维运动控制任务中效果显著。