document-processing

标签

Cards List
#document-processing

@DanKornas:传统的以文本为中心的RAG系统无法有效处理现代文档中的图像、表格、公式、图表以及多媒体…

X AI KOLs Timeline · 6天前 缓存

RAG-Anything 是一个基于 LightRAG 构建的多模态文档处理 RAG 系统,它解析文档、构建多模态知识图谱,并使用混合向量-图检索来回答问题。

0 人收藏 0 人点赞
#document-processing

Xberg v1 发布

Reddit r/LocalLLaMA · 2026-08-02

Xberg v1 作为 Kreuzberg 的继任者发布,是一个高性能内容智能框架,支持 101 种文档格式、367 种代码/数据类型、音视频转录和 URL 抓取,拥有纯 Rust 的 PDF 和 OCR 后端、多种语言绑定以及移动端/WASM 支持。

0 人收藏 0 人点赞
#document-processing

IDP AutoOpt:文档处理流水线配置的智能体驱动优化

arXiv cs.AI · 2026-07-31 缓存

本文介绍了IDP AutoOpt,一个自主的LLM智能体,用于优化智能文档处理流水线配置,以更低的成本达到或超过人类专家的准确率,并将配置时间从数周缩短至两小时以内。

0 人收藏 0 人点赞
#document-processing

@jerryjliu0: 我们很高兴为LlamaParse推出官方的批量解析体验。不再是一次一个文件地访问我们的API,而是……

X AI KOLs Following · 2026-07-30 缓存

LlamaIndex宣布为LlamaParse推出官方批量解析体验,允许用户通过专用界面一次解析多达10,000个文件,并支持批量审计和故障检查,无需再编写自定义异步脚本。

0 人收藏 0 人点赞
#document-processing

@PrajwalTomar_: 一个完全离线的AI刚刚阅读了超过4000页解密的UFO文件,并回答了关于它们的问题,且附有引用…

X AI KOLs Timeline · 2026-07-30 缓存

一个完全离线的AI使用OCR和向量数据库读取了超过4000页解密的UFO文件,在本地提供带引用的答案,无需云端或API密钥。

0 人收藏 0 人点赞
#document-processing

DocAnnot——利用生成式AI驱动的自动标注加速关键信息提取数据集的创建

arXiv cs.CL · 2026-07-29 缓存

介绍DocAnnot框架,该框架使用大型视觉语言模型、OCR以及一种空间感知的上下文匹配算法,自动生成用于文档关键信息提取的训练数据集,减少人工标注工作量。在CORD和SROIE基准测试中评估,取得了合理的F1分数,并实现了高效的人工验证。

0 人收藏 0 人点赞
#document-processing

我们使用AI将50-70小时的手动文件分类流程缩短至大约3-5小时

Reddit r/ArtificialInteligence · 2026-07-28

一个团队使用AI自动化了手动文件分类流程,通过将扫描页面分组为文档并生成PDF,将每月工作量从50-70小时减少到3-5小时。

0 人收藏 0 人点赞
#document-processing

@vista8: 感觉百度的技术底子还是很硬的。 最近这个Unlimited OCR,竟然连杨立昆(Yann LeCun)都关注到了! Unlimited OCR 提出了 Reference Sliding Window Attention (R-SWA)…

X AI KOLs Timeline · 2026-07-22 缓存

百度开源的Unlimited OCR模型提出Reference Sliding Window Attention(R-SWA)机制,以30亿参数实现数十页文档连续解析,在GitHub和HuggingFace上获得极高关注。

0 人收藏 0 人点赞
#document-processing

Verify 的本地字段提取

Product Hunt · 2026-07-07

Verify 宣布推出本地字段提取功能,即使在离线状态下也能安全提取文档数据。

0 人收藏 0 人点赞
#document-processing

PyMuPDF 新版本发布,支持 Markdown [N]

Reddit r/MachineLearning · 2026-07-01

PyMuPDF 1.28 新增了对 Markdown 的一流支持,允许通过 CSS 控制样式,从 Markdown 文本生成 PDF。

0 人收藏 0 人点赞
#document-processing

Launch HN: Parsewise (YC P25) – 通过API跨文档推理

Hacker News Top · 2026-07-01 缓存

Parsewise 是一个YC支持的API,可将非结构化文档转换为符合模式且具有可追溯来源的数据,实现跨文档的AI推理。

0 人收藏 0 人点赞
#document-processing

TurboOCR v3 — 高速文档OCR服务器 (C++/CUDA),在RTX 5090上约520张/秒

Reddit r/LocalLLaMA · 2026-06-30

TurboOCR v3 是一款自托管的高速OCR服务器,在RTX 5090上使用PP-OCRv6模型实现约每秒520张图片的处理速度,并新增了表格和公式的结构化解析功能。

0 人收藏 0 人点赞
#document-processing

@MistralDevs: https://x.com/MistralDevs/status/2071625939444744521

X AI KOLs Timeline · 2026-06-29 缓存

Mistral Devs发布了一篇教程,介绍如何使用Mistral OCR、Agents和Workflows构建医疗文档处理工作流,其中包括一个用于低置信度分类的人工审核步骤。

0 人收藏 0 人点赞
#document-processing

@hasantoxr: 我找到了为LLM时代打造的OCR工具。它叫olmOCR。olmOCR可以处理PDF、扫描件、PNG和JPEG,并将其转…

X AI KOLs Timeline · 2026-06-29 缓存

olmOCR 是来自Ai2的开源OCR工具,能够将PDF、扫描件和图像转换为干净的Markdown格式,旨在通过保留阅读顺序和处理复杂布局,为LLM流水线准备文档。

0 人收藏 0 人点赞
#document-processing

@itsclelia:LlamaParse 平台的 @n8n_io 节点现已成为官方验证的社区节点,开箱即用,即可访问…

X AI KOLs Following · 2026-06-26 缓存

LlamaIndex 已发布面向 n8n 的 LlamaParse 平台社区节点 v5 和 v6 版本,现已获得官方验证,提供文档解析、分类、拆分、提取和检索功能,可用作 AI 代理的工具。

0 人收藏 0 人点赞
#document-processing

@so_ainsight: 杂乱的文档,一条命令即可转化为结构化知识。向AI喂文档时,一个隐秘的难题是...

X AI KOLs Timeline · 2026-06-26 缓存

Hyper-Extract 是一款 Apache 2.0 开源工具,能将非结构化文档转换为结构化知识库,支持知识图谱、时间序列数据、空间信息,实现高精度AI查询。

0 人收藏 0 人点赞
#document-processing

@Ryrenz: 论文、合同、PDF——这几个开源工具把所有文档工作打通了: 1、opendatalab/MinerU(68.9k)——上海 AI Lab 出品,PDF/文档一键转 markdown,学术论文排版还原度极高 https://github.c…

X AI KOLs Timeline · 2026-06-25 缓存

这篇推文汇总了6个开源工具,涵盖PDF转markdown、文档理解、OCR、论文翻译和自动文献综述,旨在打通文档工作流。

0 人收藏 0 人点赞
#document-processing

@heynavtoor:曼哈顿的一位律师收到一份500页的合同。每一条款都必须可搜索。手动处理:一周。一位会计师…

X AI KOLs Timeline · 2026-06-24 缓存

MinerU 是一款免费开源工具,可从 PDF 和扫描文档中提取文本、表格和公式,支持109种语言和批量处理,节省数小时的手动工作。

0 人收藏 0 人点赞
#document-processing

Docling vs Liteparse vs Mineru vs Unstructured 用于大学的本地文档处理对比

Reddit r/LocalLLaMA · 2026-06-23

面向大学使用场景的本地文档处理工具(Docling、Liteparse、Mineru 和 Unstructured)对比,评估它们对本地部署的适用性。

0 人收藏 0 人点赞
#document-processing

@ErickSky: 百度刚刚打破了当前OCR最大的限制之一。Unlimited-OCR一次性处理整个文档…

X AI KOLs Timeline · 2026-06-23 缓存

百度发布了Unlimited-OCR,它可以一次性处理整个文档而无需分块,克服了当前OCR技术的一个主要限制。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈