document-intelligence

标签

Cards List
#document-intelligence

@VikParuchuri:Marker 由新的 Surya OCR 2 模型驱动(https://github.com/datalab-to/surya…),该模型是在参数量低于 1B 的模型中得分最高的…

X AI KOLs Timeline · 昨天 缓存

Datalab 宣布推出 Surya OCR 2,这是一个 650M 参数的 OCR 模型,在 olmOCR 基准测试中,参数量低于 1B 的模型里取得了最高准确率,同时速度快且支持多语言。

0 人收藏 0 人点赞
#document-intelligence

@GithubProjects:Chunkr 是一个开源文档智能服务,可将 PDF、PPT、Word 文档和图像转换为结构化…

X AI KOLs Timeline · 2026-06-27 缓存

Chunkr 是一个开源文档智能服务,将 PDF、PPT、Word 文档和图像转换为结构化块,用于 RAG 和 LLM 流水线。它具有 OCR 布局分析、结构化 HTML/Markdown 输出、视觉语言模型处理,以及通过 Docker Compose 自托管部署,可配置 LLM 提供商。

0 人收藏 0 人点赞
#document-intelligence

Mistral OCR 4

Hacker News Top · 2026-06-23 缓存

Mistral AI 发布了 Mistral OCR 4,一款紧凑型文档智能模型,能够提供边界框、块分类和内置信度评分,用于结构化文本提取。该模型支持170种语言,可在单个容器中运行以实现自托管部署,并与 Mistral Search Toolkit 集成,用于企业搜索和 RAG 管线。

0 人收藏 0 人点赞
#document-intelligence

Notum

Product Hunt · 2026-06-13

Notum是一款专为律师事务所设计的AI驱动研究与文档智能工具,旨在简化法律研究和文档管理。

0 人收藏 0 人点赞
#document-intelligence

@jerryjliu0: 我们构建了一个很酷的项目,展示了如何将核心文档智能原语组合成可复用的流水线…

X AI KOLs Following · 2026-06-04 缓存

Parse-Flow 是一个开源的可视化工作流设计器,它将文档智能原语(解析、提取、分类、拆分)组合成可复用的流水线,底层基于 LlamaIndex 和 Python 工作节点。

0 人收藏 0 人点赞
#document-intelligence

@llama_index: 大多数AI管道的质量取决于我们提供的数据,而这些数据通常意味着PDF或其他非结构化文档…

X AI KOLs Timeline · 2026-06-04 缓存

Parse-Flow 是 LlamaIndex 构建的一个开源可视化工作流设计器,它将四个文档处理原语——Parse(解析)、Classify(分类)、Split(分割)和 Extract(提取)——串联到一个由 LlamaAgents 工作流驱动的拖拽画布中,能够从非结构化企业文档(如PDF、合同和发票)中可靠地提取结构化数据。

0 人收藏 0 人点赞
#document-intelligence

@akshay_pachaar: - <1B参数 - 支持91种语言 - RTX 5090上每秒5页 - 可在CPU、GPU、MPS上运行 - 83.3% olmocr基准得分(3B以下最高)…

X AI KOLs Following · 2026-05-30 缓存

Surya OCR是一款最先进的开源OCR模型,参数少于10亿(<1B),支持91种语言,在3B参数以下的基准测试中取得最高分。

0 人收藏 0 人点赞
#document-intelligence

文档解析器如何崩溃?审计文档智能中的结构脆弱性

arXiv cs.CL · 2026-05-20 缓存

本文识别了文档布局分析鲁棒性评估中的足迹偏差,并提出了一种结构感知的审计框架,该框架解耦了探针构建与路径归因,表明小规模的结构定向探针会导致与较大扰动相当的下游性能退化。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈