标签
OCR It 是一款 Chrome 扩展,使用本地 OCR 从无法复制的文档中提取文本,旨在帮助用户为 Claude 或 ChatGPT 等 LLM 准备内容。
Firecrawl 团队开源了 pdf-inspector,一个快速 Rust 库,可自动判断 PDF 是文字版还是扫描版,并直接提取文字转成 Markdown,免去不必要的 OCR,支持表格、多栏排版识别,提供 Python/Node.js/Rust/WASM 接口。
作者描述了为其简历 PDF 构建测试套件,以确保它能被申请人追踪系统解析,并通过实验检查禁用连字是否影响 pdftotext 的输出。
介绍开源项目ai-knowledge-graph,可将长文自动拆块、抽取三元组并生成交互式知识图谱HTML,兼容OpenAI API及本地模型,适合调研和文档整理。
作者解释了为什么客户的PDF银行对账单上所有金额都显示为负数:PDF在与背景相同的灰度级别中编码了不可见的尾随负号,提取代码将其当作可见文本读取。他们讨论了OCR或剥离非黑色文本等解决方案。
Modelence Mobile App Builder 在 ProductHunt 上发布,用户可借此创建文档管理网页应用,其配套移动应用能利用手机摄像头扫描并提取文本。
本文介绍了一种技术,利用PDF规范中的替换文本属性,在PDF内部嵌入隐藏的Markdown结构,使得LLMs能够提取干净、结构化的数据,而人类看到的仍然是相同的视觉文档。
pdf-inspector 是一个开源的 Rust 库,用于智能分类 PDF 类型(文字版或扫描版),并提取文本和转换为 Markdown,避免不必要的 OCR,提高速度和节省成本。
Jerry Liu讨论了使用视觉语言模型进行PDF解析所面临的挑战,特别是关于确保文本正确性和保持正确阅读顺序的同时避免出现幻觉问题。
Firecrawl 发布了 pdf-inspector,这是一个用于 PDF 分类和文本提取的快速 Rust 库,无需 OCR 即可将基于文本的 PDF 转换为 Markdown,并提供 Python、Node.js 和 WebAssembly 的绑定。
abiruyt/text-extract-ocr 是一个开源OCR模型,可在Replicate上使用,在CPU上运行,成本低且推理速度快。