LeRF:学习用于视角转换推理的参考坐标系

Hugging Face Daily Papers 论文

摘要

LeRF 引入了一种方法,通过学习参考坐标系来增强视觉语言模型中的视角转换推理,通过监督微调和强化学习提高了在基准测试上的性能。

视角转换是空间智能的一个基本组成部分,要求模型从指定的视角解释空间关系,例如另一个实体或想象观察者的视角。尽管视觉语言模型(VLMs)的空间推理能力日益增强,但它们在视角转换方面仍然存在困难,当查询需要从不同视角进行推理时,往往默认使用摄像机视角。我们引入了用于视角转换的学习参考坐标系(LeRF),这是一个框架,训练VLMs构建和使用显式参考坐标系进行视角依赖推理。给定一张图像和一个查询,LeRF决定是否需要坐标系。如果是,它定位参考实体,并预测坐标系的原点和以实体为中心的参考坐标系。一个轻量级渲染器将坐标系叠加到图像上,使得后续可以在这些视觉线索上进行推理,而无需外部感知模型或显式3D重建。为了学习这个过程,我们首先进行监督微调,以教导选择性工具调用和参考坐标系预测,然后在空间视觉问答对上进行强化学习,以改善坐标系引导的推理。在各种视角转换基准测试中,LeRF在其骨干网络上持续改进,并与现有开源方法相比表现出色。进一步的评估还显示了参考坐标系定位和方向估计的改善,支持了学习到的参考坐标系在视角依赖推理中的有效性。
查看原文
查看缓存全文

缓存时间: 2026/09/30 04:23

论文摘要 - LeRF:学习用于视角推理的参考坐标系

来源:https://huggingface.co/papers/2609.36219

所谓的“左侧”是指摄像机视角、他人视角还是假想观察者的视角?视觉语言模型常常混淆这些视角。我们提出了LeRF,它能在推理前先显式确立所需的视角坐标系。

当需要时,模型会定位参考人物或物体,并预测其正前方、左侧和上方方向。轻量级工具会在图像上绘制这些坐标轴,模型则利用这些视觉线索来回答问题。通过监督微调来学习坐标系预测和工具选择性使用;通过强化学习来训练模型基于这些自生成的坐标系进行推理。

推理时无需外部感知模型或显式3D重建。LeRF在多个基准测试中提升了视角推理能力,包括涉及假想视角的问题。

我们期待您的反馈、疑问与建议——特别是关于学习得到的坐标系如何能支持更广泛的空间推理与具身人工智能的想法!

相似文章

强化空间视觉语言模型中的双路径推理

Hugging Face Daily Papers

本文介绍了SR-REAL,一个统一的空间视觉语言模型框架,通过强化学习结合了语言推理和三维几何推理,使得模型能够在多种任务中实现稳健的多步空间推理。