vision-language-models

标签

Cards List
#vision-language-models

在Platonic Representation Hypothesis中,什么收敛?结构而非几何

arXiv cs.LG ↗ · 14小时前 缓存

本文挑战了对Platonic Representation Hypothesis的解释,通过区分关系结构和度量几何,表明关系收敛是稳健的,而度量几何收敛在各种模型校准后较弱。

0 人收藏 0 人点赞
#vision-language-models

PRISM-VLM:一个面向紧凑型视觉语言模型的多维度鉴别性基准

arXiv cs.CL ↗ · 14小时前 缓存

PRISM-VLM 是一个多维度鉴别性基准,评估紧凑型视觉语言模型在七个维度上的表现,包括任务质量和行为鲁棒性,与单维度基准相比,能提供更可靠的区分和洞察。它旨在发布一个开放流程,供社区改进AI评估方法。

0 人收藏 0 人点赞
#vision-language-models

SpecialEduBench: 视觉语言模型在自闭症儿童语言干预中知识、技能和态度的基准测试

arXiv cs.CL ↗ · 昨天 缓存

SpecialEduBench是一个基准,旨在评估视觉语言模型执行自闭症儿童语言干预的能力,涵盖知识、技能和态度维度。

0 人收藏 0 人点赞
#vision-language-models

Spatial-Interactor: 通过与可观测物理世界的交互学习空间推理

arXiv cs.AI ↗ · 昨天 缓存

Spatial-Interactor是一个框架,通过与物理世界的交互训练视觉语言模型以增强空间推理能力,采用三级课程和两阶段训练策略来改进状态转移建模和长期集成。

0 人收藏 0 人点赞
#vision-language-models

视觉语言模型何时应观察?仅支付必要且使用的视觉调用。

arXiv cs.AI ↗ · 昨天 缓存

本文介绍CounterCredit,一种训练视觉语言智能体的方法,确保视觉调用既必要又有效,从而在基准测试中提升性能并减少无效调用。

0 人收藏 0 人点赞
#vision-language-models

ECG幻象:揭示与缓解视觉-语言模型中ECGs在临床预测中的未充分利用

arXiv cs.AI ↗ · 3天前 缓存

该研究在用于临床预测的视觉-语言模型中识别出'ECG幻象',即模型尽管具有明显的多模态能力,但未能充分利用ECG数据,并提出了视觉提示调优作为一种高效的缓解策略。

0 人收藏 0 人点赞
#vision-language-models

将视觉语言模型的智能迁移至机器人控制

Hugging Face Daily Papers ↗ · 5天前 缓存

本文提出了RoboDawn,一种将视觉语言模型智能迁移至机器人控制的方法。该方法通过零样本和单样本学习在基准测试中取得了先进结果,并在真实世界应用中验证成功。

0 人收藏 0 人点赞
#vision-language-models

Uni-LaDiR: 潜在扩散统一多模态推理

arXiv cs.LG ↗ · 6天前 缓存

Uni-LaDiR 引入了一个用于多模态推理的统一潜在扩散框架,将特定模态的思维映射到共享的潜在空间,并使用扩散来生成推理步骤,在视觉语言基准测试中取得了性能提升。

0 人收藏 0 人点赞
#vision-language-models

MintAct: 数字环境的统一视觉代理

Hugging Face Daily Papers ↗ · 6天前 缓存

MintAct 是一系列视觉语言模型,统一了 UI 定位、跨移动、桌面和 Web 的多步导航,以及视觉工具使用,在各种基准测试中达到了最先进的性能。

0 人收藏 0 人点赞
#vision-language-models

锚定关键要素:面向视觉基础多模态推理的双层学习框架

arXiv cs.AI ↗ · 2026-09-17 缓存

本文提出PIVOT,一个双层学习框架,通过自校准经验回放和视觉引导优势分配优化强化学习,以增强大型视觉语言模型中的视觉基础推理。

0 人收藏 0 人点赞
#vision-language-models

面向多智能体 VLM 系统的协作记忆

arXiv cs.AI ↗ · 2026-09-17 缓存

本文提出了一种面向多智能体视觉语言模型系统的协作记忆框架,以解决分布式感知问题,并提升共享视觉上下文和推理一致性。

0 人收藏 0 人点赞
#vision-language-models

CapMem:基于字幕的第一人称视频情景记忆基准测试

arXiv cs.AI ↗ · 2026-09-17 缓存

CapMem 是一个用于第一人称视频情景记忆的人工标注基准测试,使用字幕进行标注。研究表明,在长视频上,基于字幕的问答性能优于直接视频问答。

0 人收藏 0 人点赞
#vision-language-models

解耦算法偏差与档案伪影:大都会艺术博物馆档案中视觉-语言模型评估的受控审计

arXiv cs.LG ↗ · 2026-09-17 缓存

本研究审计CLIP模型在大都会艺术博物馆艺术品元数据中的性别偏差,发现无统计学显著偏差,但强调在AI公平性评估中需进行多变量混淆控制。

0 人收藏 0 人点赞
#vision-language-models

桥接学习的视觉感知与符号信念空间规划

arXiv cs.AI ↗ · 2026-09-16 缓存

本文提出一种新范式VLM-as-probabilistic-grounder,它将视觉语言模型中的不确定性建模为概率分布,用于符号信念空间规划,从而增强在部分可观测环境中的鲁棒性。

0 人收藏 0 人点赞
#vision-language-models

ReDraft,不要只蒸馏:用于持续VLLM后训练的参考驱动修订

arXiv cs.AI ↗ · 2026-09-16 缓存

ReDraft 是一种参考驱动修订方法,用于大型视觉语言模型的持续后训练,平衡新任务的学习和旧任务的保留,比SFT等标准方法实现更高的准确性和更少的遗忘。

0 人收藏 0 人点赞
#vision-language-models

高效推理蒸馏:通过合成思维链与难度感知微调的小型视频语言模型

arXiv cs.LG ↗ · 2026-09-16 缓存

本文提出了一种方法,利用合成的思维链理由和难度感知微调,将推理能力蒸馏到紧凑的视频语言模型中,使较小的模型能够在最小的计算开销下超越较大的模型。

0 人收藏 0 人点赞
#vision-language-models

从估计的听者注视学习指称

arXiv cs.CL ↗ · 2026-09-15 缓存

本文提出了一种方法,通过利用听者注视数据进行训练,增强视觉-语言模型中的指称表达生成,从而实现更高效和成功的交流。

0 人收藏 0 人点赞
#vision-language-models

深入VLM图表阅读:从空间与深度追踪垂直条形图中的数值读取

arXiv cs.CL ↗ · 2026-09-15 缓存

本文研究了视觉语言模型如何通过控制反事实激活修补技术从垂直条形图中读取精确数值,揭示了内部计算机制以及Qwen和InternVL等模型之间的差异。

0 人收藏 0 人点赞
#vision-language-models

@LLMJunky: 这是我见过的最酷炫的AI(VLM)应用之一。

X AI KOLs Following ↗ · 2026-09-14 缓存

@LLMJunky的一条推文强调了AI中视觉语言模型(VLM)的一个令人印象深刻的应用,分享了对其酷炫功能的热情。

0 人收藏 0 人点赞
#vision-language-models

PhysBrain 1.5:从视觉-语言模型到物理基础模型

Hugging Face Daily Papers ↗ · 2026-09-14 缓存

PhysBrain 1.5 是一个统一模型,通过自回归训练集成物理环境理解、动作生成和未来状态预测,在28个具身基准测试中实现了最先进的开源性能。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈