lvlm

标签

Cards List
#lvlm

SpatialBlock: 通过合成堆叠方块问题增强LVLMs中的空间智能

Hugging Face Daily Papers ↗ · 2026-09-07 缓存

本文介绍了SpatialBlock-15k,这是一个针对堆叠方块问题的合成数据集,旨在提升大型视觉语言模型中的3D空间推理能力,并展示了性能的改进和对现实世界任务的泛化能力。

0 人收藏 0 人点赞
#lvlm

当眼见不为实:交互式视觉定位在LVLMs中的基准测试

arXiv cs.AI ↗ · 2026-08-26 缓存

本文介绍了一个用于大型视觉语言模型(LVLMs)中交互式视觉定位的受控评估框架,表明当前LVLMs的表现低于人类基线,并在主动问题驱动定位方面存在困难。

0 人收藏 0 人点赞
#lvlm

从失败中学习:基于硬负样本的检索中心思维链用于统一多模态检索

Hugging Face Daily Papers ↗ · 2026-08-06 缓存

本文提出了UniME-R1,一种用于统一多模态检索的嵌入器-顾问框架,该框架基于检索反馈生成检索中心思维链(RC-CoT),通过从硬负样本中学习来提升检索性能。

0 人收藏 0 人点赞
#lvlm

[R] CausalVLBench:大型视觉语言模型中视觉因果推理的基准测试。

Reddit r/MachineLearning ↗ · 2026-08-02 缓存

这篇arXiv论文介绍了CausalVLBench,这是一个用于评估大型视觉语言模型中视觉因果推理的基准,涵盖三个任务:因果结构推断、干预目标预测和反事实预测。它在三个因果表示学习数据集上评估了开源LVLM,揭示了其优势与不足。

0 人收藏 0 人点赞
#lvlm

LVLMs 能否揭示视觉错觉背后的真相?感知与推理能力分析

arXiv cs.CL ↗ · 2026-07-31 缓存

本文介绍了 IllusionReasoning,一个使用真实世界视觉错觉的基准,用于联合评估大型视觉语言模型(LVLMs)的感知和推理能力,发现当前模型的推理能力并不像声称的那样先进。

0 人收藏 0 人点赞
#lvlm

LVLMs在指代通信中的隐式与显式提示策略

arXiv cs.CL ↗ · 2026-06-17 缓存

本文研究了关于大型视觉语言模型(LVLMs)能否协调高效指代表达的看似矛盾的发现。作者表明,当明确提示时,模型可以实现效率,但从隐式提示中无法推断出效率需求,揭示了人类与AI通信之间的关键差异。

0 人收藏 0 人点赞
#lvlm

UniDoc-RL:基于层次化动作与密集奖励的粗到细视觉RAG

Hugging Face Daily Papers ↗ · 2026-04-16 缓存

UniDoc-RL 提出了一种面向大型视觉-语言模型的强化学习框架,通过层次化决策与密集多奖励监督来优化检索、重排序和视觉推理,在视觉RAG任务上相较此前基于RL的方法实现了高达17.7%的性能提升。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈