标签
本文评估了开放多模态大语言模型在高棉文档视觉问答上的性能,发现虽然模型在处理英语和数字内容方面表现良好,但理解原生高棉脚本仍然具有挑战性。该研究使用了KH-FUNSD集合中的诊断子集,并比较了不同的模型配置。
InSight-doc 是一个面向长文档理解的智能体视觉感知框架,在推理过程中自适应地分配视觉分辨率,在提高文档 VQA 基准准确率的同时减少幻觉和推理延迟。该论文发布了 8B 模型、数据集和代码。
本文介绍了DocTrace,一个用于长文档视觉问答的分层框架,将该任务建模为显式证据图推理。它在三个基准上取得了最先进的结果,同时实现了可追踪的证据来源,比Qwen3-VL-8B-Instruct高出11-14个百分点。