pdf-parsing

标签

Cards List
#pdf-parsing

@AIExplorerTim: 有人刚刚开发了一个工具,可以将 PDF 转换为 干净、结构化的 Markdown 速度达到 100 页/秒 不需要 GPU。 不需要 API 成本。 没有混乱的解析。 只有原始的、可用的数据。 它可以轻松处理的内容: • 表格 → 完美提…

X AI KOLs Timeline ↗ · 2026-05-09 缓存

OpenDataLoader 是一个开源工具,可将 PDF 转换为结构化的 Markdown 和 JSON,支持 100 页/秒的本地处理速度,无需 GPU 或 API 成本,专为 RAG 管道和 PDF 无障碍自动化设计。

0 人收藏 0 人点赞
#pdf-parsing

@jerryjliu0: 使用VLM解析PDF的一个缺点是难以保证输出文本的*正确性*和正确的阅读顺序……

X AI KOLs Following ↗ · 2026-04-18 缓存

Jerry Liu讨论了使用视觉语言模型进行PDF解析所面临的挑战,特别是关于确保文本正确性和保持正确阅读顺序的同时避免出现幻觉问题。

0 人收藏 0 人点赞
#pdf-parsing

Docling 项目文档

GitHub Trending (daily) ↗ · 2026-09-19 缓存

Docling 是一个开源文档处理工具,可解析多种格式,包括高级 PDF 理解功能,并与 LangChain 和 LlamaIndex 等生成式 AI 生态系统提供集成。

0 人收藏 0 人点赞
#pdf-parsing

PaddlePaddle/PaddleOCR

GitHub Trending (daily) ↗ · 2026-06-05

PaddleOCR是一个功能强大、轻量级的OCR工具包,可将PDF和图像转换为结构化数据,适用于AI应用,支持100多种语言,旨在连接文档与大语言模型。

0 人收藏 0 人点赞
#pdf-parsing

run-llama/liteparse

GitHub Trending (daily) ↗ · 2026-05-29 缓存

LiteParse 是 run-llama 推出的一个独立的开源 PDF 解析工具,提供快速、本地的空间文本提取及边界框,支持多种编程语言和平台。

0 人收藏 0 人点赞
← Previous
← 返回首页

提交意见反馈