通过宽基线匹配激发MLLMs中的复杂空间推理
摘要
本文介绍了ReasonMatch-Bench,一个用于多模态大语言模型中宽基线匹配的基准,并提出了动态对应强化学习(DCRL)以提升空间推理能力。实验表明,该方法在基准测试上取得了显著提升,同时保持了通用性能。
查看缓存全文
缓存时间: 2026/06/04 03:41
论文页面 - 通过宽基线匹配引导多模态大语言模型进行复杂空间推理
来源:https://huggingface.co/papers/2606.03577 作者:
,
,
,
,
,
,
,
,
,
摘要
宽基线匹配为多模态大语言模型提供了一个具有挑战性的空间推理测试平台,需要当前模型所缺乏的系统化评估与训练框架,为此我们引入了ReasonMatch-Bench与动态对应强化学习以提升性能。
宽基线匹配(Wide-baseline matching, WBM)需要整合几何理解、视角变化、细粒度感知以及遮挡推理,使其成为部署于物理环境中的多模态大语言模型(MLLMs)进行空间推理的挑战性测试平台。然而,当前的MLLMs缺乏针对这些能力的系统化评估与训练框架。我们引入了ReasonMatch-Bench,这是一个根据视角偏移与匹配粒度在室内、室外及物体中心场景中分层设计的基准测试,结果显示当前MLLMs在细粒度宽基线对应上仍存在困难:在一个包含90个样本的困难子集上,人类标注者达到了84.0 F1,而现有最佳基线仅达到37.2。为弥补这一差距,我们构建了一个可扩展的数据生成流水线,该流水线能够自动从大规模视频-3D语料库(包括RGB-D视频和SfM重建)中提取宽基线视图对,从而产生多样化且可验证的监督信号。我们进一步提出了动态对应强化学习(DCRL),它结合了图像级视角递进和点级对应课程,通过可验证的奖励机制优化WBM训练,无需显式的思维链监督。大量实验表明,DCRL显著改进了ReasonMatch-Bench的性能,并迁移至相关空间基准测试,同时在多个基准测试上保持一般视觉理解性能,并略有提升。
查看 arXiv 页面 (https://arxiv.org/abs/2606.03577) 查看 PDF (https://arxiv.org/pdf/2606.03577) 项目页面 (https://aim-uofa.github.io/reasonmatch/) GitHub7 (https://github.com/aim-uofa/ReasonMatch) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.03577)
在您的代理中获取此论文:
hf papers read 2606\.03577
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
无模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2606.03577 即可从此页面链接。
引用此论文的数据集1
ReasonMatch/ReasonMatch 查看器•更新于6分钟前 • 40 (https://huggingface.co/datasets/ReasonMatch/ReasonMatch)
引用此论文的 Space0
无 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2606.03577 即可从此页面链接。
包含此论文的收藏集0
无收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从此页面链接。
相似文章
超越正确性:混合思维多模态大语言模型的响应行为基准测试与对齐
本文介绍了PatternEval,一个用于评估混合思维多模态大语言模型中响应模式故障的诊断基准,并提出了PatternRL,通过带有特定惩罚的强化学习来对齐这些模式。
BilliardPhys-Bench: 多模态大语言模型的物理推理与视觉动态基准测试
BilliardPhys-Bench 是一个新的基准测试,通过合成台球场景来评估多模态大语言模型的物理推理能力,要求预测碰撞和最终球的位置。论文发现,当前模型在较长的模拟中表现不佳,并表现出一种“静态偏差”——在不确定时预测无交互。
将漂移转化为约束:非平稳环境下的鲁棒推理对齐
本文引入了 CXR-MAX,这是一个大规模基准,旨在利用来自多个多模态大语言模型(MLLM)的 X 射线数据,评估非平稳环境下的推理对齐性能。
SpatialWorld: 多模态智能体在真实世界任务中的交互式空间推理基准测试
SpatialWorld是一个统一的基准测试,用于评估多模态智能体在各种真实世界任务中的交互式空间推理能力。结果表明,即使是最强大的模型,其任务成功率也很低。
Mr.LHDR: 一个针对多模态真实世界长周期深度研究代理的基准
本文介绍了Mr.LHDR,一个用于评估多模态真实世界长周期深度研究代理的基准,表明当前模型在复杂推理链中难以实现依赖一致的证据整合。