document-extraction

标签

Cards List
#document-extraction

@jerryjliu0:今天我们正式推出 Extract v2.5——一系列专为文档抽取调优的前沿智能体。这些智能体(兼具成本效益……

X AI KOLs Timeline ↗ · 7小时前 缓存

LlamaIndex 推出 Extract v2.5,这是一套前沿智能体文档抽取模型(Cost Effective、Agentic、Agentic Plus),宣称在 ExtractBench 上实现当前最佳性价比,以 30% 至 4 倍更低成本超越 Opus 5.5 和 GPT-6 Sol,并在长列表、跨页记录和扫描表单方面大幅提升准确率,同时推出可在 LlamaParse 上使用的新功能:高级引用(Advanced Citations)和结构化推理(Structural Reasoning)。

0 人收藏 0 人点赞
#document-extraction

@jerryjliu0: 预测模型不确定性是一个困难的问题。完美“校准”的置信度分数是输出正确与否的确切概率值……

X AI KOLs Timeline ↗ · 2026-09-24 缓存

一份实用指南,介绍如何在文档提取中使用置信度分数,通过设置精确率和召回率的阈值来平衡自动化和准确性。

0 人收藏 0 人点赞
#document-extraction

@jerryjliu0: 我们构建了世界上最先进的复杂文档提取引擎,下面的视频展示了一个概览…

X AI KOLs Timeline ↗ · 2026-09-24 缓存

LlamaIndex 推出了 LlamaExtract Agentic Plus,这是一款先进的 AI 引擎,用于从复杂文档中提取数据,如长表格和表单,并正在推广其 LlamaParse 服务以提升文档处理能力。

0 人收藏 0 人点赞
#document-extraction

@jerryjliu0: 随着jev,每个人都理解校准置信度分数在离散决策中的重要性。我们已…

X AI KOLs Timeline ↗ · 2026-09-21 缓存

LlamaParse引入校准置信度分数用于模式引导的文档提取,支持各种数据类型并提供边界框以增强人工审查和自动化工作流。

0 人收藏 0 人点赞
#document-extraction

Mizan:用于评估大型语言模型在伊拉克阿拉伯语及伊拉克公民语境下的国家级基准

arXiv cs.CL ↗ · 2026-09-15 缓存

Mizan 引入了一个国家级基准,用于评估大型语言模型在伊拉克阿拉伯语和公民语境下的表现,突出了以 MSA 为重点的评估中存在的差距,并揭示了安全加固模型中的过度拒绝问题。

0 人收藏 0 人点赞
#document-extraction

@jerryjliu0: 任何文档的闪电般提取。ICYMI,我们上周发布了Extract Turbo,支持处理文档……

X AI KOLs Following ↗ · 2026-09-11 缓存

LlamaIndex推出了Extract Turbo,这是一项能够从文档中高速、高精度提取结构化数据的功能。

0 人收藏 0 人点赞
#document-extraction

@jerryjliu0:Astra 或许终于能帮我自动化自公司成立以来花了数百小时做的事情:制作…

X AI KOLs Following ↗ · 2026-09-06 缓存

Jerry Liu 演示了 LlamaIndex 的 Astra 智能体如何通过计算机操作和浏览器自动化自主生成完整的产品演示视频,同时展示了 LlamaParse 全新的 Agentic Plus 模式,该模式可从复杂的财务文档中提取数十个字段。

0 人收藏 0 人点赞
#document-extraction

使用Arctic Embed和Bonsai 8B在iPhone 16上演示本地文档提取(52页)(KernelAI应用)

Reddit r/LocalLLaMA ↗ · 2026-08-30

KernelAI移动应用在iPhone 16上使用Arctic Embed和Bonsai 8B模型进行52页本地文档提取的演示,展示了v2版本的新功能,包括网络搜索和自定义模型导入。

0 人收藏 0 人点赞
#document-extraction

文档提取管道中的静默记录丢失

Reddit r/AI_Agents ↗ · 2026-08-23

文章强调了文档提取管道中的一个常见问题,即大文档会导致静默记录丢失,并推荐使用完整性检查和如llamaparse之类的工具来维护数据完整性。

0 人收藏 0 人点赞
#document-extraction

@jerryjliu0: 我们观察到的一个有趣属性是,在模式引导的复杂文档提取任务中,编码代理…

X AI KOLs Timeline ↗ · 2026-08-22 缓存

文章总结了ParseBench论文的研究结果,指出像Claude Code和Codex这样的编码代理在模式引导的文档提取任务中提供了成本效益高的基线,尤其是在较长文档上,与专业OCR工具相比。

0 人收藏 0 人点赞
#document-extraction

文档抽取中基于字段的选择性风险控制:三种失效模式、一个有效性阶梯及其有效条件

arXiv cs.LG ↗ · 2026-08-18 缓存

本文剖析了文档抽取系统中基于字段的选择性风险控制的三种失效模式,并提出一个由低到高的有效性阶梯式修复方案,通过使用前沿AI模型在真实数据上的实验证明了其改进效果。

0 人收藏 0 人点赞
#document-extraction

@llama_index: 大多数文档提取API无法告知数据来源。对于ExtractBench,我们严格评估了溯源性:一个…

X AI KOLs Timeline ↗ · 2026-08-17 缓存

ExtractBench 是一个新的文档提取基准测试,严格评分溯源准确性,显示 VLMs 和编码代理缺乏证据,而 LlamaExtract Agentic Plus 以高性能领先于页面级和单词级指标。

0 人收藏 0 人点赞
#document-extraction

预路由推理:面向成本高效文档字段提取

arXiv cs.CL ↗ · 2026-08-10 缓存

本文研究了是否可以在推理之前使用低成本特征预测文档提取难度,从而使路由器能够在廉价模型与强大模型之间进行选择。路由在某些体裁中最多可降低77%的成本,同时保持质量,但前提是难度存在差异且可从文档特征中预测。

0 人收藏 0 人点赞
#document-extraction

Xberg:面向智能体的本地“读取任意文档”工具

Reddit r/AI_Agents ↗ · 2026-08-04

Xberg 是一个本地内容智能框架(Rust 核心,MIT 许可),通过 MCP 服务器或 CLI 从 101 种文档格式中提取文本,重建阅读顺序和表格,并为上下文窗口分块——所有操作均在设备端完成,服务于 AI 智能体。

0 人收藏 0 人点赞
#document-extraction

ExtractBench:面向模式引导的企业文档抽取基准

Hugging Face Daily Papers ↗ · 2026-07-31 缓存

ExtractBench 是一个用于模式引导的企业文档抽取的新基准,在 4,869 页企业文档上评估值准确率、记录完整性、溯源性和成本。作者发现,商业 VLM 在处理长文档时表现不佳,而编码智能体虽然更准确但成本较高;LlamaExtract AgenticPlus 在所有指标上均领先。

0 人收藏 0 人点赞
#document-extraction

DECODEM: 通过增强方法从公司组织文档中提取数据

arXiv cs.CL ↗ · 2026-07-20 缓存

介绍DECODEM,这是一个基准数据集,用于评估使用大型语言模型从法律文档中自动提取公司治理变量的方法,结果显示对许多条款具有高准确性。

0 人收藏 0 人点赞
#document-extraction

Kreuzberg (本地文档提取) 被重命名为 Xberg - 当前版本为长期支持版本

Reddit r/LocalLLaMA ↗ · 2026-07-12

Kreuzberg,一个本地文档提取工具,被重命名为 Xberg,其当前版本处于长期支持(LTS)阶段。

0 人收藏 0 人点赞
#document-extraction

@mdancho84: 告别文档提取器。Google 刚刚发布了 LangExtract:开源。免费。比价值10万美元的企业工具更强大。以下是……

X AI KOLs Timeline ↗ · 2026-07-07 缓存

Google 发布了 LangExtract,一款开源免费且性能超越昂贵企业工具的文档提取工具。

0 人收藏 0 人点赞
#document-extraction

在RTX 3060上运行的Qwen3.6-35B-A3B能否取代Google Vision进行收据到JSON的提取?

Reddit r/LocalLLaMA ↗ · 2026-06-26

一位开发者分享了在RTX 3060上使用本地Qwen VL模型将日语收据解析为JSON的经验,取代了Google Vision,结果显示关键字段提取准确,每张收据约需31秒。

0 人收藏 0 人点赞
#document-extraction

@hasantoxr: 现在只需一条命令就能将杂乱文档转化为结构化知识。它叫做Hyper-Extract。大多数RAG工具只是…

X AI KOLs Timeline ↗ · 2026-06-25 缓存

Hyper-Extract 是一款命令行工具,可将凌乱的非结构化文档转化为结构化知识,如知识图谱、超图、时间/空间图及Obsidian vault,支持本地LLM推理与MCP集成。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈