标签
本文介绍了SpatialBlock-15k,这是一个针对堆叠方块问题的合成数据集,旨在提升大型视觉语言模型中的3D空间推理能力,并展示了性能的改进和对现实世界任务的泛化能力。
本文介绍了一个用于大型视觉语言模型(LVLMs)中交互式视觉定位的受控评估框架,表明当前LVLMs的表现低于人类基线,并在主动问题驱动定位方面存在困难。
本文提出了UniME-R1,一种用于统一多模态检索的嵌入器-顾问框架,该框架基于检索反馈生成检索中心思维链(RC-CoT),通过从硬负样本中学习来提升检索性能。
这篇arXiv论文介绍了CausalVLBench,这是一个用于评估大型视觉语言模型中视觉因果推理的基准,涵盖三个任务:因果结构推断、干预目标预测和反事实预测。它在三个因果表示学习数据集上评估了开源LVLM,揭示了其优势与不足。
本文介绍了 IllusionReasoning,一个使用真实世界视觉错觉的基准,用于联合评估大型视觉语言模型(LVLMs)的感知和推理能力,发现当前模型的推理能力并不像声称的那样先进。
本文研究了关于大型视觉语言模型(LVLMs)能否协调高效指代表达的看似矛盾的发现。作者表明,当明确提示时,模型可以实现效率,但从隐式提示中无法推断出效率需求,揭示了人类与AI通信之间的关键差异。
UniDoc-RL 提出了一种面向大型视觉-语言模型的强化学习框架,通过层次化决策与密集多奖励监督来优化检索、重排序和视觉推理,在视觉RAG任务上相较此前基于RL的方法实现了高达17.7%的性能提升。