标签
本文挑战了对Platonic Representation Hypothesis的解释,通过区分关系结构和度量几何,表明关系收敛是稳健的,而度量几何收敛在各种模型校准后较弱。
PRISM-VLM 是一个多维度鉴别性基准,评估紧凑型视觉语言模型在七个维度上的表现,包括任务质量和行为鲁棒性,与单维度基准相比,能提供更可靠的区分和洞察。它旨在发布一个开放流程,供社区改进AI评估方法。
SpecialEduBench是一个基准,旨在评估视觉语言模型执行自闭症儿童语言干预的能力,涵盖知识、技能和态度维度。
Spatial-Interactor是一个框架,通过与物理世界的交互训练视觉语言模型以增强空间推理能力,采用三级课程和两阶段训练策略来改进状态转移建模和长期集成。
本文介绍CounterCredit,一种训练视觉语言智能体的方法,确保视觉调用既必要又有效,从而在基准测试中提升性能并减少无效调用。
该研究在用于临床预测的视觉-语言模型中识别出'ECG幻象',即模型尽管具有明显的多模态能力,但未能充分利用ECG数据,并提出了视觉提示调优作为一种高效的缓解策略。
本文提出了RoboDawn,一种将视觉语言模型智能迁移至机器人控制的方法。该方法通过零样本和单样本学习在基准测试中取得了先进结果,并在真实世界应用中验证成功。
Uni-LaDiR 引入了一个用于多模态推理的统一潜在扩散框架,将特定模态的思维映射到共享的潜在空间,并使用扩散来生成推理步骤,在视觉语言基准测试中取得了性能提升。
MintAct 是一系列视觉语言模型,统一了 UI 定位、跨移动、桌面和 Web 的多步导航,以及视觉工具使用,在各种基准测试中达到了最先进的性能。
本文提出PIVOT,一个双层学习框架,通过自校准经验回放和视觉引导优势分配优化强化学习,以增强大型视觉语言模型中的视觉基础推理。
本文提出了一种面向多智能体视觉语言模型系统的协作记忆框架,以解决分布式感知问题,并提升共享视觉上下文和推理一致性。
CapMem 是一个用于第一人称视频情景记忆的人工标注基准测试,使用字幕进行标注。研究表明,在长视频上,基于字幕的问答性能优于直接视频问答。
本研究审计CLIP模型在大都会艺术博物馆艺术品元数据中的性别偏差,发现无统计学显著偏差,但强调在AI公平性评估中需进行多变量混淆控制。
本文提出一种新范式VLM-as-probabilistic-grounder,它将视觉语言模型中的不确定性建模为概率分布,用于符号信念空间规划,从而增强在部分可观测环境中的鲁棒性。
ReDraft 是一种参考驱动修订方法,用于大型视觉语言模型的持续后训练,平衡新任务的学习和旧任务的保留,比SFT等标准方法实现更高的准确性和更少的遗忘。
本文提出了一种方法,利用合成的思维链理由和难度感知微调,将推理能力蒸馏到紧凑的视频语言模型中,使较小的模型能够在最小的计算开销下超越较大的模型。
本文提出了一种方法,通过利用听者注视数据进行训练,增强视觉-语言模型中的指称表达生成,从而实现更高效和成功的交流。
本文研究了视觉语言模型如何通过控制反事实激活修补技术从垂直条形图中读取精确数值,揭示了内部计算机制以及Qwen和InternVL等模型之间的差异。
@LLMJunky的一条推文强调了AI中视觉语言模型(VLM)的一个令人印象深刻的应用,分享了对其酷炫功能的热情。
PhysBrain 1.5 是一个统一模型,通过自回归训练集成物理环境理解、动作生成和未来状态预测,在28个具身基准测试中实现了最先进的开源性能。