document-extraction

标签

Cards List
#document-extraction

预路由推理:面向成本高效文档字段提取

arXiv cs.CL · 3天前 缓存

本文研究了是否可以在推理之前使用低成本特征预测文档提取难度,从而使路由器能够在廉价模型与强大模型之间进行选择。路由在某些体裁中最多可降低77%的成本,同时保持质量,但前提是难度存在差异且可从文档特征中预测。

0 人收藏 0 人点赞
#document-extraction

Xberg:面向智能体的本地“读取任意文档”工具

Reddit r/AI_Agents · 2026-08-04

Xberg 是一个本地内容智能框架(Rust 核心,MIT 许可),通过 MCP 服务器或 CLI 从 101 种文档格式中提取文本,重建阅读顺序和表格,并为上下文窗口分块——所有操作均在设备端完成,服务于 AI 智能体。

0 人收藏 0 人点赞
#document-extraction

ExtractBench:面向模式引导的企业文档抽取基准

Hugging Face Daily Papers · 2026-07-31 缓存

ExtractBench 是一个用于模式引导的企业文档抽取的新基准,在 4,869 页企业文档上评估值准确率、记录完整性、溯源性和成本。作者发现,商业 VLM 在处理长文档时表现不佳,而编码智能体虽然更准确但成本较高;LlamaExtract AgenticPlus 在所有指标上均领先。

0 人收藏 0 人点赞
#document-extraction

DECODEM: 通过增强方法从公司组织文档中提取数据

arXiv cs.CL · 2026-07-20 缓存

介绍DECODEM,这是一个基准数据集,用于评估使用大型语言模型从法律文档中自动提取公司治理变量的方法,结果显示对许多条款具有高准确性。

0 人收藏 0 人点赞
#document-extraction

Kreuzberg (本地文档提取) 被重命名为 Xberg - 当前版本为长期支持版本

Reddit r/LocalLLaMA · 2026-07-12

Kreuzberg,一个本地文档提取工具,被重命名为 Xberg,其当前版本处于长期支持(LTS)阶段。

0 人收藏 0 人点赞
#document-extraction

@mdancho84: 告别文档提取器。Google 刚刚发布了 LangExtract:开源。免费。比价值10万美元的企业工具更强大。以下是……

X AI KOLs Timeline · 2026-07-07 缓存

Google 发布了 LangExtract,一款开源免费且性能超越昂贵企业工具的文档提取工具。

0 人收藏 0 人点赞
#document-extraction

在RTX 3060上运行的Qwen3.6-35B-A3B能否取代Google Vision进行收据到JSON的提取?

Reddit r/LocalLLaMA · 2026-06-26

一位开发者分享了在RTX 3060上使用本地Qwen VL模型将日语收据解析为JSON的经验,取代了Google Vision,结果显示关键字段提取准确,每张收据约需31秒。

0 人收藏 0 人点赞
#document-extraction

@hasantoxr: 现在只需一条命令就能将杂乱文档转化为结构化知识。它叫做Hyper-Extract。大多数RAG工具只是…

X AI KOLs Timeline · 2026-06-25 缓存

Hyper-Extract 是一款命令行工具,可将凌乱的非结构化文档转化为结构化知识,如知识图谱、超图、时间/空间图及Obsidian vault,支持本地LLM推理与MCP集成。

0 人收藏 0 人点赞
#document-extraction

超越Logprobs:一种基于多信号的LLM文档字段提取置信度引擎

arXiv cs.CL · 2026-06-24 缓存

ExtractConf是一种用于基于LLM的文档字段提取的置信度估计方法,它通过两种结构不同的调用(字段引导和文档引导)来推导不一致信号,在DocILE发票数据集上实现了0.928的ROC AUC,并为高风险自动化场景提供了可靠的选择性预测能力。

0 人收藏 0 人点赞
#document-extraction

Agentic Document Extraction

Product Hunt · 2026-06-17

Agentic Document Extraction 是一款利用AI智能体从非结构化文档中提取结构化数据,使文档变得可计算化的工具。

0 人收藏 0 人点赞
#document-extraction

@jerryjliu0: 每个企业组织都会接收和生成大量合同。每份合同通常遵循……

X AI KOLs Following · 2026-06-15 缓存

LlamaIndex 在 LlamaParse 中引入了 Extract 功能,利用布局感知解析和 LLM,将非结构化的合同数据转换为结构化的、机器可读的元数据,以应对非标准模板和交叉引用等挑战。

0 人收藏 0 人点赞
#document-extraction

@tom_doerr: 将图像和PDF转换为Markdown,无需OCR https://github.com/NanoNets/docext

X AI KOLs Timeline · 2026-05-08 缓存

docext是一个本地部署的工具包,无需OCR即可将图像和PDF转换为Markdown,利用视觉语言模型。它还引入了Nanonets-OCR-s,一个紧凑的3B参数模型,用于高效的图像到Markdown转换。

0 人收藏 0 人点赞
#document-extraction

olmOCR:利用视觉语言模型解锁PDF中的数万亿Token

Papers with Code Trending · 2025-02-25 缓存

olmOCR 是一个开源工具包,使用微调的视觉语言模型从PDF中提取干净的文本,同时保留结构,并针对大规模批处理进行了优化。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈