text-extraction

标签

Cards List
#text-extraction

OCR It – 从无法复制的文档中提取文本,为您的 LLM 服务

Hacker News Top · 2026-08-24 缓存

OCR It 是一款 Chrome 扩展,使用本地 OCR 从无法复制的文档中提取文本,旨在帮助用户为 Claude 或 ChatGPT 等 LLM 准备内容。

0 人收藏 0 人点赞
#text-extraction

@GitHub_Daily: 给大模型喂 PDF 文档,常见做法是先跑 OCR 再提文字,但实际上有一半多的 PDF 本来就是文字版,根本不需要 OCR。 Firecrawl 团队最近开源的 pdf-inspector,能自动判断 PDF 是文字版还是扫描版,文字版的…

X AI KOLs Timeline · 2026-08-05 缓存

Firecrawl 团队开源了 pdf-inspector,一个快速 Rust 库,可自动判断 PDF 是文字版还是扫描版,并直接提取文字转成 Markdown,免去不必要的 OCR,支持表格、多栏排版识别,提供 Python/Node.js/Rust/WASM 接口。

0 人收藏 0 人点赞
#text-extraction

PDF 的测试

Lobsters Hottest · 2026-08-04 缓存

作者描述了为其简历 PDF 构建测试套件,以确保它能被申请人追踪系统解析,并通过实验检查禁用连字是否影响 pdftotext 的输出。

0 人收藏 0 人点赞
#text-extraction

@XAMTO_AI: 市面上工具一大堆,能把长文自动转成知识图谱的倒是少见。 ai-knowledge-graph,GitHub上约2.6k星。 扔进去一篇文档,拆块、抽三元组、建图谱,最后吐出一个可交互的HTML可视化页面。 兼容OpenAI API,本地模…

X AI KOLs Timeline · 2026-08-02 缓存

介绍开源项目ai-knowledge-graph,可将长文自动拆块、抽取三元组并生成交互式知识图谱HTML,兼容OpenAI API及本地模型,适合调研和文档整理。

0 人收藏 0 人点赞
#text-extraction

为什么所有金额值都是负数?

Hacker News Top · 2026-08-02 缓存

作者解释了为什么客户的PDF银行对账单上所有金额都显示为负数:PDF在与背景相同的灰度级别中编码了不可见的尾随负号,提取代码将其当作可见文本读取。他们讨论了OCR或剥离非黑色文本等解决方案。

0 人收藏 0 人点赞
#text-extraction

@artahian: 我们在 @ProductHunt 上上线了!Modelence Mobile App Builder 来了:在发布页面的演示视频中(仅2分钟…

X AI KOLs Following · 2026-07-01 缓存

Modelence Mobile App Builder 在 ProductHunt 上发布,用户可借此创建文档管理网页应用,其配套移动应用能利用手机摄像头扫描并提取文本。

0 人收藏 0 人点赞
#text-extraction

根据阅读者身份变化的PDF

Hacker News Top · 2026-06-12 缓存

本文介绍了一种技术,利用PDF规范中的替换文本属性,在PDF内部嵌入隐藏的Markdown结构,使得LLMs能够提取干净、结构化的数据,而人类看到的仍然是相同的视觉文档。

0 人收藏 0 人点赞
#text-extraction

@knowledgefxg: 实用开源小工具推荐:pdf-inspector 解决的是一个很实际的问题:并不是所有 PDF 都需要 OCR。 比方说你扔给它一个 PDF,它先判断这个 PDF 到底是什么类型——是正常的文字版(比如用 Word 导出的)、还是扫描版(图…

X AI KOLs Timeline · 2026-05-22 缓存

pdf-inspector 是一个开源的 Rust 库,用于智能分类 PDF 类型(文字版或扫描版),并提取文本和转换为 Markdown,避免不必要的 OCR,提高速度和节省成本。

0 人收藏 0 人点赞
#text-extraction

@jerryjliu0: 使用VLM解析PDF的一个缺点是难以保证输出文本的*正确性*和正确的阅读顺序……

X AI KOLs Following · 2026-04-18 缓存

Jerry Liu讨论了使用视觉语言模型进行PDF解析所面临的挑战,特别是关于确保文本正确性和保持正确阅读顺序的同时避免出现幻觉问题。

0 人收藏 0 人点赞
#text-extraction

firecrawl/pdf-inspector

GitHub Trending (daily) · 2026-08-03 缓存

Firecrawl 发布了 pdf-inspector,这是一个用于 PDF 分类和文本提取的快速 Rust 库,无需 OCR 即可将基于文本的 PDF 转换为 Markdown,并提供 Python、Node.js 和 WebAssembly 的绑定。

0 人收藏 0 人点赞
#text-extraction

abiruyt/text-extract-ocr

Replicate Explore · 2026-05-17 缓存

abiruyt/text-extract-ocr 是一个开源OCR模型,可在Replicate上使用,在CPU上运行,成本低且推理速度快。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈