vqa

标签

Cards List
#vqa

DrawingVQA:一个用于建筑图纸多深度视觉-文本推理的真实世界基准

arXiv cs.AI · 2026-07-20 缓存

介绍了DrawingVQA,这是首个用于评估多模态大语言模型在真实建筑图纸上表现的基准,包含33张图纸和92组涵盖三种推理深度的问答对,揭示了模型与专家性能之间的差距。

0 人收藏 0 人点赞
#vqa

@_philschmid: 需要用于OCR或VQA的模型吗?试试Gemini 3.5 Flash。Gemini 3.5 Flash更快、更便宜、更准确。详情 ↓

X AI KOLs Following · 2026-07-06 缓存

推广Gemini 3.5 Flash,称其用于OCR和VQA任务时更快、更便宜、更准确。

0 人收藏 0 人点赞
#vqa

识别与解决知识型VQA基准测试的陷阱:审计、修复与增强

arXiv cs.CL · 2026-07-02 缓存

本文对知识型VQA基准进行了审计,揭示了系统性的假设违反,使得准确率成为误导性指标。它提出了一种修复协议和多实体增强方法,以恢复答案可推导性和问题清晰度,表明修正后的设置产生了显著不同的模型排名。

0 人收藏 0 人点赞
#vqa

Robusto-2:在利马和纽约市对人与VLMs进行自动驾驶基准测试

Hugging Face Daily Papers · 2026-06-18 缓存

本文研究了自动驾驶系统与人类在不同地理位置(利马和纽约市)的视觉问答任务中的表现,发现人类和VLM无论地点如何都表现出相似的性能,但根据问题类型存在差异。

0 人收藏 0 人点赞
#vqa

OpenMedQ:面向医学视觉语言模型的广泛开放预训练

arXiv cs.AI · 2026-06-12 缓存

OpenMedQ 是一个完全开放的医学视觉语言模型,在 14 个数据集(约 335 万样本)上进行预训练,在医学 VQA 和分类基准上取得了最先进的结果。

0 人收藏 0 人点赞
#vqa

从大语言模型中蒸馏答案集编程规则用于神经符号视觉问答

arXiv cs.AI · 2026-06-03 缓存

本文提出了一种从大语言模型中蒸馏答案集编程规则的方法,以增强神经符号视觉问答,结果表明仅需少量示例即可生成正确的规则。

0 人收藏 0 人点赞
#vqa

文本编辑能否泛化到视觉生成?统一多模态模型中的跨模态知识编辑基准测试

arXiv cs.CL · 2026-06-02 缓存

本文介绍了UniKE,这是首个针对统一多模态模型(UMMs)的跨模态知识编辑基准测试,揭示了显著的模态差距:文本编辑实现了92%的效果,但仅有18.5%迁移到图像生成。它提出了Reasoning-augmented Parameter Editing,以改善跨模态迁移,提升幅度高达18.6个百分点。

0 人收藏 0 人点赞
#vqa

HakushoBench:来自政府白皮书的日语图表和表格VQA基准

Hugging Face Daily Papers · 2026-05-31 缓存

HakushoBench是一个基于政府白皮书构建的日语图表和表格VQA基准,用于评估视觉语言模型对复杂视觉数据的理解能力。该基准对开源权重模型具有挑战性,最佳准确率仅为58.6%,与专有模型之间相差34.9个百分点。

0 人收藏 0 人点赞
#vqa

高效训练长上下文视觉语言模型,实现超越128K上下文的泛化

Hugging Face Daily Papers · 2026-05-13 缓存

本文系统研究了视觉语言模型的长上下文持续预训练,通过高效的数据混合设计,实现了超越128K上下文的泛化,并介绍了MMProLong模型。

0 人收藏 0 人点赞
#vqa

SGOCR:一个空间定位的、以OCR为核心的流水线与V1数据集 [P]

Reddit r/MachineLearning · 2026-04-20

大家好!我一直在独立研究和开发小巧但强大的视觉语言模型(VLM),并注意到视觉数据集中的一个空白——没有一个数据集在教我的模型简单地将文本定位到图像中,而是试图让模型推理文本或场景本身。这促使我投入两周的副项目,创建了SGOCR,一个开源数据集流水线,用于生成空间定位的、以OCR为核心的VQA元组,包含大量丰富的元数据以支持多样化的VLM训练策

0 人收藏 0 人点赞
← 返回首页

提交意见反馈