LeRF:学习用于视角转换推理的参考坐标系
摘要
LeRF 引入了一种方法,通过学习参考坐标系来增强视觉语言模型中的视角转换推理,通过监督微调和强化学习提高了在基准测试上的性能。
查看缓存全文
缓存时间: 2026/09/30 04:23
论文摘要 - LeRF:学习用于视角推理的参考坐标系
来源:https://huggingface.co/papers/2609.36219
所谓的“左侧”是指摄像机视角、他人视角还是假想观察者的视角?视觉语言模型常常混淆这些视角。我们提出了LeRF,它能在推理前先显式确立所需的视角坐标系。
当需要时,模型会定位参考人物或物体,并预测其正前方、左侧和上方方向。轻量级工具会在图像上绘制这些坐标轴,模型则利用这些视觉线索来回答问题。通过监督微调来学习坐标系预测和工具选择性使用;通过强化学习来训练模型基于这些自生成的坐标系进行推理。
推理时无需外部感知模型或显式3D重建。LeRF在多个基准测试中提升了视角推理能力,包括涉及假想视角的问题。
我们期待您的反馈、疑问与建议——特别是关于学习得到的坐标系如何能支持更广泛的空间推理与具身人工智能的想法!
相似文章
看不清还是想不对?面向视觉语言推理的感知奖励
本文提出一种强化学习框架,通过显式奖励感知保真度来改善视觉语言模型中的感知-推理协同,利用“蒙眼推理”代理和结构化言语验证来解决模态信用分配中的模糊性。
强化空间视觉语言模型中的双路径推理
本文介绍了SR-REAL,一个统一的空间视觉语言模型框架,通过强化学习结合了语言推理和三维几何推理,使得模型能够在多种任务中实现稳健的多步空间推理。
MIRAGE: 基于强化学习引导的多角度创造性语言模型推理
论文介绍了 MIRAGE,这是一个推理时框架,通过使用强化学习引导动态切换视角来增强 LLM 推理,在各种基准测试中优于现有的提示方法。
Perceive-to-Reason:解耦感知与推理实现细粒度视觉推理
提出Perceive-to-Reason(P2R)框架,通过两阶段流程和角色感知的强化学习策略,将视觉语言模型中的视觉感知与推理解耦,在细粒度视觉推理基准上达到最先进水平。
Lens:将正确的语义视角聚焦于无训练多模态表示学习
本文介绍了Lens,这是一个用于多模态表示学习的无训练框架,它解决了语义视角不对齐的问题,在MMEB数据集上取得了显著的性能提升,无需参数更新。