document-vqa

标签

Cards List
#document-vqa

多模态大语言模型真的理解低资源高棉文档吗?关于高棉文档视觉问答的一项初步研究

arXiv cs.CL · 5天前 缓存

本文评估了开放多模态大语言模型在高棉文档视觉问答上的性能,发现虽然模型在处理英语和数字内容方面表现良好,但理解原生高棉脚本仍然具有挑战性。该研究使用了KH-FUNSD集合中的诊断子集,并比较了不同的模型配置。

0 人收藏 0 人点赞
#document-vqa

InSight-doc:面向长文档理解的智能体视觉感知

Hugging Face Daily Papers · 2026-08-11 缓存

InSight-doc 是一个面向长文档理解的智能体视觉感知框架,在推理过程中自适应地分配视觉分辨率,在提高文档 VQA 基准准确率的同时减少幻觉和推理延迟。该论文发布了 8B 模型、数据集和代码。

0 人收藏 0 人点赞
#document-vqa

DocTrace:通过分层证据图推理实现可追踪的长文档VQA

arXiv cs.AI · 2026-08-05 缓存

本文介绍了DocTrace,一个用于长文档视觉问答的分层框架,将该任务建模为显式证据图推理。它在三个基准上取得了最先进的结果,同时实现了可追踪的证据来源,比Qwen3-VL-8B-Instruct高出11-14个百分点。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈