document-understanding

标签

Cards List
#document-understanding

CiteVQA: 面向可信文档智能的证据归因基准测试

Hugging Face Daily Papers · 2026-05-13 缓存

CiteVQA 是一个面向文档视觉-语言模型的基准,它同时评估答案正确性与支持证据的引用,揭示了广泛的归因幻觉现象,即模型提供正确答案但引用错误区域。

0 人收藏 0 人点赞
#document-understanding

DocScope:用于值得信赖的长文档理解的可靠推理基准测试

arXiv cs.CL · 2026-05-12 缓存

DocScope 是一个新的基准测试,旨在评估多模态大语言模型在长文档上的可靠推理能力和可信度,引入了包含页面定位、区域定位、事实提取和答案验证四个阶段的评估协议。

0 人收藏 0 人点赞
#document-understanding

DocAtlas:跨越80多种语言的多语言文档理解

Hugging Face Daily Papers · 2026-05-12 缓存

DocAtlas是一个框架,通过差异渲染和合成生成,构建了覆盖82种语言的高保真OCR数据集和基准。它表明,直接偏好优化能够改善多语言模型的适配,而不会降低基础语言的性能。

0 人收藏 0 人点赞
#document-understanding

numind/NuExtract3

Hugging Face Models Trending · 2026-04-29 缓存

NuExtract3 是一个 4B 参数规模的视觉-语言推理模型,用于文档理解,支持结构化提取和图像到 Markdown 的转换。

0 人收藏 0 人点赞
#document-understanding

@jerryjliu0:ParseBench 是首个在完整企业文档中评测 VLM 图表理解能力的基准

X AI KOLs Timeline · 2026-04-21 缓存

ParseBench 首次把图表理解放进整份企业文档中评测视觉-语言模型,填补了以往仅针对孤立图表的基准空白。

0 人收藏 0 人点赞
#document-understanding

@techNmak:1.7B 参数轻量 VLM,在 OmniDocBench 上碾压巨头的 OCR 新王者

X AI KOLs Timeline · 2026-04-20 缓存

仅 1.7B 参数的多语言文档解析器 dots.ocr,用轻量体积实现 SOTA,证明文档理解无需巨无霸模型。

0 人收藏 0 人点赞
#document-understanding

Granite 4.0 3B Vision:面向企业文档的紧凑型多模态智能模型

Hugging Face Blog · 2026-03-31 缓存

IBM 发布 Granite 4.0 3B Vision,这是一款专为理解企业文档而设计的紧凑型视觉语言模型,具备表格提取、基于 ChartNet 的图表解读以及键值对 grounding 等专业能力。

0 人收藏 0 人点赞
#document-understanding

CommonForms:一个用于表单字段检测的大规模多样化数据集

Papers with Code Trending · 2025-09-20 缓存

本文介绍了 CommonForms,一个大规模、多样化的表单字段检测数据集,以及在该任务上实现高精度的 FFDNet 模型。数据集、模型和代码均已开源。

0 人收藏 0 人点赞
#document-understanding

infiniflow/ragflow

GitHub Trending (daily) · 2026-08-12 缓存

RAGFlow 是 Infiniflow 开发的开源 RAG 引擎,它利用深度文档理解从文档中提取和组织知识,支持多种 LLM 和自托管,从而实现可靠的检索增强生成。

0 人收藏 0 人点赞
← Previous
← 返回首页

提交意见反馈