标签
这条推文对 Gemini 3.6 Flash 和 Gemini 3.5 Flash Lite 在文档理解方面进行了基准测试,发现虽然 Flash 系列最初在视觉理解方面表现出色,但最新版本由于针对编码和推理进行了后期训练,性能已趋于平稳甚至有所退步。
DeepSeek OCR 2 是一个拥有3B参数的模型,在OCR和文档理解方面超越了Gemini 3 Pro,具有类似人类的阅读顺序,并支持本地微调。
SynthDocBench 是一个完全合成的长上下文视觉文档理解基准,它系统地控制文档长度、布局、模态和问题类型,揭示了当前VLM中的失败模式,如长度退化和位置敏感性。
LlamaIndex对GPT-5.6在文档理解方面进行了基准测试,发现其相比GPT-5.5没有改进;该模型在文本和表格上表现良好,但在图表和布局方面仍有不足。
提出了BaFCo,一个面向孟加拉语表单理解的基准数据集,重点关注文档布局分析(DLA)和关键信息提取(KIE)。该数据集包含200份多页复杂孟加拉国政府表单,涵盖26种实体类型的细粒度标注,并对多个多模态大型语言模型(MLLMs)进行了评估,揭示了当前模型在理解复杂孟加拉语表单方面的局限性。
HunyuanOCR-1.5 是一款轻量级端到端OCR视觉语言模型,通过DFlash(推理速度提升6.37倍)提高效率,通过Agentic Data Flow增强能力,在文档解析、OCR和多语言任务上达到顶级性能。
LEDGER是一个新的基准测试,用于评估大语言模型在企业年报上的长上下文能力,提供了4,999份数字化报告,包含31个财务关键绩效指标,以及涵盖检索和提取的三项评估任务。
Jerry Liu的团队正在CVPR 2026上展示ParseBench,这是一个针对视觉语言模型(VLM)的全面文档理解基准。该基准包含2000页真实企业文档,以及针对表格、图表和视觉定位的评估指标。
MM-BizRAG 是一个面向企业问答的多模态检索增强生成系统,通过文档结构感知分割和版式感知解析,在异构企业文档上的表现比以视觉为中心的基线方法最高提升 32%。该论文还提出了 FastRAGEval——一种基于 LLM 的高效评估指标,其与人类判断的对齐程度优于 RAGChecker,且成本更低。
LFRAG提出了一种面向布局的细粒度检索增强生成框架,该框架在多模态文档中从页面级检索转向块级检索,在新提出的LFDocQA基准上实现了最先进的性能,并将令牌数量减少了73%。
纳斯达克专访了Llama Index首席执行官Jerry Liu,讨论了该公司用于企业AI代理的文档理解与OCR技术,本次合作基于Wing VC的Enterprise Tech 30榜单。
LlamaIndex发布了ParseBench,这是一个用于评估AI智能体文档理解能力的全面基准测试,涵盖包含表格、图表和布局的复杂企业文档。将举办一场在线研讨会,讨论该基准测试的方法和结果。
Infinity 发布了两个开源权重模型,Infinity-Parser2-Pro(35B)和 Infinity-Parser2-Flash(2B),它们登顶了 ParseBench 文档理解排行榜,利用了合成数据引擎和一种新颖的联合强化学习算法。
CiteVQA 是一个面向文档视觉-语言模型的基准,它同时评估答案正确性与支持证据的引用,揭示了广泛的归因幻觉现象,即模型提供正确答案但引用错误区域。
DocScope 是一个新的基准测试,旨在评估多模态大语言模型在长文档上的可靠推理能力和可信度,引入了包含页面定位、区域定位、事实提取和答案验证四个阶段的评估协议。
DocAtlas是一个框架,通过差异渲染和合成生成,构建了覆盖82种语言的高保真OCR数据集和基准。它表明,直接偏好优化能够改善多语言模型的适配,而不会降低基础语言的性能。
NuExtract3 是一个 4B 参数规模的视觉-语言推理模型,用于文档理解,支持结构化提取和图像到 Markdown 的转换。
ParseBench 首次把图表理解放进整份企业文档中评测视觉-语言模型,填补了以往仅针对孤立图表的基准空白。
仅 1.7B 参数的多语言文档解析器 dots.ocr,用轻量体积实现 SOTA,证明文档理解无需巨无霸模型。
IBM 发布 Granite 4.0 3B Vision,这是一款专为理解企业文档而设计的紧凑型视觉语言模型,具备表格提取、基于 ChartNet 的图表解读以及键值对 grounding 等专业能力。