document-understanding

标签

Cards List
#document-understanding

@elonmusk: Grok 4.6 登顶 @databricks

X AI KOLs Timeline · 2026-08-12 缓存

Elon Musk 宣布 Grok 4.6 登顶 Databricks,Ivan Zhou 报告称,使用 Databricks 的 Genie 测试框架,在 OfficeQA Pro V2 上实现了 SOTA 性能。

0 人收藏 0 人点赞
#document-understanding

@ma_sc_:我一直在测试除官方支持的14种语言之外的许多其他语言,结果真的非常令人惊讶。……

X AI KOLs Following · 2026-08-12 缓存

一位用户分享了在多种语言上测试Liquid AI新推出的LFM2.5-VL-3B视觉语言模型的惊人结果,指出其视觉能力很强,但指令跟随能力低于预期;Liquid AI宣布该模型能够读取屏幕、文档,并将物体定位到坐标。

0 人收藏 0 人点赞
#document-understanding

多页视觉丰富文档理解中的故障定位:一项实证归因研究

arXiv cs.AI · 2026-08-11 缓存

一项关于多页视觉丰富文档理解(MP-VRDU)失败的实证归因研究,隔离了表示、选择与推理三种失败模式,并为在固定计算预算下构建此类系统提供了指导。

0 人收藏 0 人点赞
#document-understanding

nvidia/NVIDIA-Nemotron-Parse-2.0 · Hugging Face

Reddit r/LocalLLaMA · 2026-08-06 缓存

NVIDIA 发布 Nemotron Parse 2.0,这是一个文档图像解析模型,可将扫描的 PDF 和图像转换为带有布局、边界框和阅读顺序的结构化文本,并增加了多语言 OCR 改进和图表感知解析功能。

0 人收藏 0 人点赞
#document-understanding

XL-DocBench:证据支撑的超长文档理解基准测试

arXiv cs.CL · 2026-08-04 缓存

介绍了XL-DocBench,这是一个经过人工验证的超长文档理解基准,涵盖六个专业领域的1,519个问题,要求多页证据和结构化推理,表明当前大语言模型在处理长上下文专业文档时仍存在困难。

0 人收藏 0 人点赞
#document-understanding

VLD-RAG:面向长篇幅、视觉丰富多页文档的智能视觉语言检索增强生成

arXiv cs.CL · 2026-07-29 缓存

本文提出 VLD-RAG,一种用于在长篇幅、视觉丰富文档上进行问答的智能多模态检索增强生成框架。它使用保留页面的索引和验证器引导的智能体工作流,改进跨页证据检索和推理,在 LongDocURL 和 MMLongBench-Doc 等基准测试上优于以往的基于视觉的基线方法。

0 人收藏 0 人点赞
#document-understanding

VLMs 是阅读还是改写?关于视觉语言模型转录忠实性的研究

arXiv cs.CL · 2026-07-27 缓存

本文揭示了视觉语言模型在面对错别字或视觉伪影等扰动时,往往会改写文本而非忠实转录,并引入了 FaithC4 基准来评估多种模型和语言中的这种行为。

0 人收藏 0 人点赞
#document-understanding

@jerryjliu0: 我们在文档理解方面对 Gemini 3.6 Flash 和 Gemini 3.5 Flash Lite 进行了基准测试。我们与之前的版本进行了比较…

X AI KOLs Following · 2026-07-22 缓存

这条推文对 Gemini 3.6 Flash 和 Gemini 3.5 Flash Lite 在文档理解方面进行了基准测试,发现虽然 Flash 系列最初在视觉理解方面表现出色,但最新版本由于针对编码和推理进行了后期训练,性能已趋于平稳甚至有所退步。

0 人收藏 0 人点赞
#document-understanding

@0x0SojalSec: 3B小模型 DeepSeek OCR 2 击败 Gemini 3 Pro。本地运行。DeepSeek OCR 2,一个最先进的3B模型,比Gemini 3 P…

X AI KOLs Timeline · 2026-07-15 缓存

DeepSeek OCR 2 是一个拥有3B参数的模型,在OCR和文档理解方面超越了Gemini 3 Pro,具有类似人类的阅读顺序,并支持本地微调。

0 人收藏 0 人点赞
#document-understanding

SynthDocBench:长上下文视觉文档理解的控制基准

Hugging Face Daily Papers · 2026-07-11 缓存

SynthDocBench 是一个完全合成的长上下文视觉文档理解基准,它系统地控制文档长度、布局、模态和问题类型,揭示了当前VLM中的失败模式,如长度退化和位置敏感性。

0 人收藏 0 人点赞
#document-understanding

@jerryjliu0:我们对GPT-5.6在文档理解方面进行了全面基准测试。总体来说,GPT-5.6 Sol与GPT-5.5相比没有变化…

X AI KOLs Timeline · 2026-07-09 缓存

LlamaIndex对GPT-5.6在文档理解方面进行了基准测试,发现其相比GPT-5.5没有改进;该模型在文本和表格上表现良好,但在图表和布局方面仍有不足。

0 人收藏 0 人点赞
#document-understanding

BaFCo:针对复杂孟加拉语表单理解的文档理解基准

arXiv cs.CL · 2026-07-08 缓存

提出了BaFCo,一个面向孟加拉语表单理解的基准数据集,重点关注文档布局分析(DLA)和关键信息提取(KIE)。该数据集包含200份多页复杂孟加拉国政府表单,涵盖26种实体类型的细粒度标注,并对多个多模态大型语言模型(MLLMs)进行了评估,揭示了当前模型在理解复杂孟加拉语表单方面的局限性。

0 人收藏 0 人点赞
#document-understanding

HunyuanOCR-1.5:让轻量级OCR视觉语言模型更快更优

Hugging Face Daily Papers · 2026-07-06 缓存

HunyuanOCR-1.5 是一款轻量级端到端OCR视觉语言模型,通过DFlash(推理速度提升6.37倍)提高效率,通过Agentic Data Flow增强能力,在文档解析、OCR和多语言任务上达到顶级性能。

0 人收藏 0 人点赞
#document-understanding

LEDGER:企业年报长上下文有依据金融检索与提取基准测试

arXiv cs.CL · 2026-06-12 缓存

LEDGER是一个新的基准测试,用于评估大语言模型在企业年报上的长上下文能力,提供了4,999份数字化报告,包含31个财务关键绩效指标,以及涵盖检索和提取的三项评估任务。

0 人收藏 0 人点赞
#document-understanding

@jerryjliu0: 我们的团队在CVPR 2026现场,想打招呼就过来吧 :)

X AI KOLs Following · 2026-06-04 缓存

Jerry Liu的团队正在CVPR 2026上展示ParseBench,这是一个针对视觉语言模型(VLM)的全面文档理解基准。该基准包含2000页真实企业文档,以及针对表格、图表和视觉定位的评估指标。

0 人收藏 0 人点赞
#document-understanding

MM-BizRAG:重新思考面向通用企业问答的多模态检索增强生成

arXiv cs.CL · 2026-06-04 缓存

MM-BizRAG 是一个面向企业问答的多模态检索增强生成系统,通过文档结构感知分割和版式感知解析,在异构企业文档上的表现比以视觉为中心的基线方法最高提升 32%。该论文还提出了 FastRAGEval——一种基于 LLM 的高效评估指标,其与人类判断的对齐程度优于 RAGChecker,且成本更低。

0 人收藏 0 人点赞
#document-understanding

LFRAG:面向布局的多模态文档理解细粒度检索增强生成

arXiv cs.AI · 2026-05-25 缓存

LFRAG提出了一种面向布局的细粒度检索增强生成框架,该框架在多模态文档中从页面级检索转向块级检索,在新提出的LFDocQA基准上实现了最先进的性能,并将令牌数量减少了73%。

0 人收藏 0 人点赞
#document-understanding

@NasdaqExchange: “我们专注于提供一流的文档理解与OCR技术。”与@Wing_VC合作…

X AI KOLs Following · 2026-05-24 缓存

纳斯达克专访了Llama Index首席执行官Jerry Liu,讨论了该公司用于企业AI代理的文档理解与OCR技术,本次合作基于Wing VC的Enterprise Tech 30榜单。

0 人收藏 0 人点赞
#document-understanding

@jerryjliu0:目前有很多针对AI智能体的编码和推理基准测试,但在文档理解方面却很少——而这正是所有下游知识工作的前提。

X AI KOLs Following · 2026-05-18 缓存

LlamaIndex发布了ParseBench,这是一个用于评估AI智能体文档理解能力的全面基准测试,涵盖包含表格、图表和布局的复杂企业文档。将举办一场在线研讨会,讨论该基准测试的方法和结果。

0 人收藏 0 人点赞
#document-understanding

@jerryjliu0:一组新的开源权重模型正在登顶文档理解排行榜,INF 刚刚发布了两个模型:Inf…

X AI KOLs Following · 2026-05-15 缓存

Infinity 发布了两个开源权重模型,Infinity-Parser2-Pro(35B)和 Infinity-Parser2-Flash(2B),它们登顶了 ParseBench 文档理解排行榜,利用了合成数据引擎和一种新颖的联合强化学习算法。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈