vision-language

标签

Cards List
#vision-language

M$^3$R-Bench:证据支撑的多模态隐喻理解统一基准

arXiv cs.CL · 2天前 缓存

本文介绍了M3R-Bench,一个包含1,000个图文实例的统一证据支撑多模态隐喻理解基准,并提出了M3R-Reasoner,一个结合基于课程学习的推理监督和强化学习的8B参数模型,其性能优于更大的专有模型。

0 人收藏 0 人点赞
#vision-language

一致性存在可计算的盲点:视觉语言图表读取中无标签可靠性的交换理论

arXiv cs.LG · 2天前 缓存

本文提出了一种用于视觉语言图表读取中无标签可靠性的交换理论,表明基于一致性的方法存在可计算的盲点,并引入了一种通过循环重标记增强的等变一致性评分。

0 人收藏 0 人点赞
#vision-language

nvidia/NVIDIA-Nemotron-Parse-2.0 · Hugging Face

Reddit r/LocalLLaMA · 2天前 缓存

NVIDIA 发布 Nemotron Parse 2.0,这是一个文档图像解析模型,可将扫描的 PDF 和图像转换为带有布局、边界框和阅读顺序的结构化文本,并增加了多语言 OCR 改进和图表感知解析功能。

0 人收藏 0 人点赞
#vision-language

CARGO-VL:面向视觉-语言模型的反事实仲裁与风险约束组优化

arXiv cs.AI · 3天前 缓存

介绍了CARGO-VL,一种面向视觉-语言模型的组相对优化框架,通过反事实一致性和风险约束控制,改进对冲突图像-文本证据的处理以及不支持答案的回避,并提供了XMC冲突训练资源。

0 人收藏 0 人点赞
#vision-language

ChronoVision:通过潜在状态重建进行时间推理

Hugging Face Daily Papers · 3天前 缓存

ChronoVision 是一个多模态框架,通过将视觉逻辑与潜在图像对齐,使用重构视觉头、ROI 注意力定位模块和强化学习,改进视觉语言模型中的时间推理。它引入了 Vbvr-VQA 数据集,并在时间跟踪基准上达到了 SOTA 准确率。

0 人收藏 0 人点赞
#vision-language

ethanfel/Qwen3-VL-32B-Ultra-Heretic-MiniMax-H3-ComfyUI-INT8-ConvRot

Hugging Face Models Trending · 6天前 缓存

该仓库提供 Qwen3-VL-32B 的 INT8 ConvRot 量化 ComfyUI safetensors,包括包含第 0-49 层的 MiniMax-H3 条件编码器,以及用于第 50-63 层的可选提示增强尾部,专为在 32GB GPU 上的 ComfyUI 使用而设计。

0 人收藏 0 人点赞
#vision-language

谄媚行为削弱协作视觉-语言任务中的认知警觉性

arXiv cs.CL · 6天前 缓存

本文提出了一种信息不对称的“找不同”任务,用于衡量视觉-语言模型中的认知警觉性,结果发现模型常常忽略私有证据以迎合对话伙伴。通过模型引导减少谄媚行为,可以提高协作任务的可靠性。

0 人收藏 0 人点赞
#vision-language

ZeroR@CHiPSAL 2026:基于对比学习的两阶段视觉-语言适配用于尼泊尔表情包分类

arXiv cs.CL · 6天前 缓存

本文描述了一个用于尼泊尔表情包分类的两阶段视觉-语言适配系统,使用Qwen3-VL-8B-Instruct,结合LoRA微调和对比学习。该系统在CHiPSAL 2026共享任务中,在仇恨言论检测中排名第二,在情感分析中排名第四。

0 人收藏 0 人点赞
#vision-language

CAPEval:一种跨越理解与生成的解耦式图像描述评估方法

Hugging Face Daily Papers · 6天前 缓存

介绍了CAPEval,一个将覆盖率和精确度解耦的图像描述评估框架,表明覆盖率能更好地预测视觉-语言理解性能,而精确度则能更好地预测文本到图像生成性能。

0 人收藏 0 人点赞
#vision-language

DeepVoyager-VL:激励长时程多模态智能体的视觉在环搜索

Hugging Face Daily Papers · 6天前 缓存

DeepVoyager-VL 提出了一种长时程多模态深度搜索框架,将视觉证据融入中间推理过程,利用多模态事件图进行数据合成和微调,而无需强化学习,在十个基准测试上取得了强劲性能。

0 人收藏 0 人点赞
#vision-language

3DZip: 面向3D问答的空间感知特征多样性引导的令牌压缩

Hugging Face Daily Papers · 2026-08-02 缓存

3DZip是一个面向3D视觉语言模型的三阶段令牌压缩框架,利用体素化、多样性引导的锚点选择和空间约束合并来减少令牌数量,同时保持空间推理能力。在3DQA基准上,仅使用128个令牌即可保留94.7%的原始性能,并实现1.92倍的推理加速。

0 人收藏 0 人点赞
#vision-language

内部松弛,全局均衡:面向视觉-语言混合专家模型的几何引导负载均衡方法

Hugging Face Daily Papers · 2026-08-01 缓存

本文提出 ReBA(Relax Within, Balance Across),一种面向视觉-语言混合专家模型的几何引导负载均衡方法。该方法通过分别平衡图像和文本标记,并对相关的视觉标记进行分组,来解决特定模态的路由不平衡问题,从而提升在不同分辨率和组合变化下的鲁棒性。

0 人收藏 0 人点赞
#vision-language

Poplar:一种可扩展的以人为中心的图像数据集合成流水线

Hugging Face Daily Papers · 2026-08-01 缓存

介绍了 Poplar,一个可扩展的 Specify-Render-Inspect 流水线,用于合成以人为中心的图像数据集,并发布了 Poplar-9K,这是一个包含 9,401 个图像-文本对的精选数据集,附带可审计的检查记录。

0 人收藏 0 人点赞
#vision-language

@HuggingModels:认识一下 Mage-VL,多模态 AI 的游戏规则改变者!它在一个模型中处理图像、文本甚至视频理解。……

X AI KOLs Timeline · 2026-07-31 缓存

Mage-VL 被介绍为一款多模态 AI 模型,它在一个模型中处理图像、文本和视频理解,从而支持更丰富的交互式应用。

0 人收藏 0 人点赞
#vision-language

VLD-RAG:面向长篇幅、视觉丰富多页文档的智能视觉语言检索增强生成

arXiv cs.CL · 2026-07-29 缓存

本文提出 VLD-RAG,一种用于在长篇幅、视觉丰富文档上进行问答的智能多模态检索增强生成框架。它使用保留页面的索引和验证器引导的智能体工作流,改进跨页证据检索和推理,在 LongDocURL 和 MMLongBench-Doc 等基准测试上优于以往的基于视觉的基线方法。

0 人收藏 0 人点赞
#vision-language

RRS-10K:面向罕见遥感图像解读的多任务视觉-语言模型基准

arXiv cs.AI · 2026-07-29 缓存

RRS-10K是一个用于评估视觉-语言模型在罕见遥感图像解读方面的基准数据集,包含超过10,000张军事相关图像和多种任务格式。对52个模型的评估显示其零样本性能中等,且在视觉定位和复杂推理方面存在明显不足。

0 人收藏 0 人点赞
#vision-language

ProcAgent:一种在边缘设备上支持人在回路中的程序性任务指导的智能体框架

arXiv cs.AI · 2026-07-29 缓存

ProcAgent 是一个完全在设备端运行的、基于视觉的智能体程序助手,采用提出-验证架构,在 NVIDIA Jetson AGX Orin 上实现实时自适应指导。它支持反应式和主动式两种模式,并支持人在回路中的确认,实现响应式交互,并在用户研究中获得积极评价。

0 人收藏 0 人点赞
#vision-language

看见还是知道?多模态大语言模型中的视觉上下文敏感性

Hugging Face Daily Papers · 2026-07-28 缓存

本文探讨了当视觉证据与语言先验冲突时,多模态大语言模型为何在视觉中心任务上失败,引入了WhatIfVis基准,并表明模型通常能编码视觉证据,但无法可靠地控制对其的依赖。

0 人收藏 0 人点赞
#vision-language

从零开始的原生多模态预训练扩展

Hugging Face Daily Papers · 2026-07-24 缓存

本文研究了原生多模态预训练的扩展性质,推导了在固定预算下的计算最优模型大小和令牌数量,并揭示了语言和多模态目标的不同扩展行为。

0 人收藏 0 人点赞
#vision-language

视觉对比自蒸馏

Hugging Face Daily Papers · 2026-07-23 缓存

VCSD通过使用内容擦除的对照图像产生对比信号,消除了在策略自蒸馏中对外部教师、特权答案或视觉证据的需求,在视觉语言基准测试中持续优于现有方法。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈