ocr

标签

Cards List
#ocr

@MaximeRivest:这款设备非常令人印象深刻。它具备麦克风、扬声器支持、文字转语音、OCR、ChatGPT 5.2 聊天,而且……

X AI KOLs Following · 昨天 缓存

一位用户分享了对一款轻薄、基于 Android 的设备的实机感受,该设备具备麦克风、扬声器、OCR、文字转语音和 ChatGPT 5.2 聊天功能,并指出其唯一明显的缺点是缺少彩色。

0 人收藏 0 人点赞
#ocr

nvidia/NVIDIA-Nemotron-Parse-2.0 · Hugging Face

Reddit r/LocalLLaMA · 2天前 缓存

NVIDIA 发布 Nemotron Parse 2.0,这是一个文档图像解析模型,可将扫描的 PDF 和图像转换为带有布局、边界框和阅读顺序的结构化文本,并增加了多语言 OCR 改进和图表感知解析功能。

0 人收藏 0 人点赞
#ocr

我用不同类型,比较了更多解析器在14项PDF解析能力上的表现

Reddit r/LocalLLaMA · 2天前

一项基准测试比较了8款PDF解析器在14项能力上的表现,发现Chandra最准确,同时也指出了速度等方面的权衡;LightOnOCR-1B以小体积令人印象深刻,但在无法辨认的文本上会产生幻觉。

0 人收藏 0 人点赞
#ocr

Xberg:面向智能体的本地“读取任意文档”工具

Reddit r/AI_Agents · 5天前

Xberg 是一个本地内容智能框架(Rust 核心,MIT 许可),通过 MCP 服务器或 CLI 从 101 种文档格式中提取文本,重建阅读顺序和表格,并为上下文窗口分块——所有操作均在设备端完成,服务于 AI 智能体。

0 人收藏 0 人点赞
#ocr

我用6种文档类型对比了MinerU、Granite-Docling和PaddleOCR-VL的12项PDF解析能力

Reddit r/LocalLLaMA · 5天前

一位开发者对三种PDF解析模型(MinerU、Granite-Docling、PaddleOCR-VL)在六种文档类型和十二项能力上进行了基准测试,发现MinerU会丢失页脚,除非重建其markdown,而Granite-Docling输出更干净的原生markdown表格。

0 人收藏 0 人点赞
#ocr

@DanKornas:Dicklesworthstone/llm_aided_ocr 使用LLM驱动的文本校正对扫描PDF进行OCR GitHub:存档:

X AI KOLs Timeline · 6天前 缓存

llm_aided_ocr 是一个 GitHub 项目,它对扫描的 PDF 执行 OCR,并使用 LLM 来纠正和改进提取的文本。

0 人收藏 0 人点赞
#ocr

将所有内容转换为 Markdown

Hacker News Top · 2026-07-31 缓存

Klartext 是一款免费、注重隐私的在线工具,可将 PDF、扫描件、照片、Word、Excel 和 PowerPoint 文件转换为 Markdown(以及 JSON),整个过程完全在其自有服务器上进行,24 小时后自动删除,且不依赖任何外部 AI/OCR 服务。

0 人收藏 0 人点赞
#ocr

space ocr

Product Hunt · 2026-07-31

Space OCR 是一个能够自我检查答案的 OCR 工具,可作为应用或 API 使用。

0 人收藏 0 人点赞
#ocr

IDP AutoOpt:文档处理流水线配置的智能体驱动优化

arXiv cs.AI · 2026-07-31 缓存

本文介绍了IDP AutoOpt,一个自主的LLM智能体,用于优化智能文档处理流水线配置,以更低的成本达到或超过人类专家的准确率,并将配置时间从数周缩短至两小时以内。

0 人收藏 0 人点赞
#ocr

@PrajwalTomar_: 一个完全离线的AI刚刚阅读了超过4000页解密的UFO文件,并回答了关于它们的问题,且附有引用…

X AI KOLs Timeline · 2026-07-30 缓存

一个完全离线的AI使用OCR和向量数据库读取了超过4000页解密的UFO文件,在本地提供带引用的答案,无需云端或API密钥。

0 人收藏 0 人点赞
#ocr

如果你的PDF提取器返回的是空字符串,那文件可能并没有损坏。

Reddit r/AI_Agents · 2026-07-30

一位开发者描述了构建PDF分类工具的过程,该工具通过检查PDF结构来判断其包含文本层还是由扫描图像组成,从而避免静默的空提取失败,并分享了关于虚假文本检测和幻影表格的陷阱。

0 人收藏 0 人点赞
#ocr

VLMs 是阅读还是改写?关于视觉语言模型转录忠实性的研究

arXiv cs.CL · 2026-07-27 缓存

本文揭示了视觉语言模型在面对错别字或视觉伪影等扰动时,往往会改写文本而非忠实转录,并引入了 FaithC4 基准来评估多种模型和语言中的这种行为。

0 人收藏 0 人点赞
#ocr

@jerryjliu0: 我们刚刚发布了LiteParse的一个功能,该功能允许在Rust中原生处理图像到PDF的转换,从而去除对外部包的依赖……

X AI KOLs Following · 2026-07-25 缓存

LiteParse是一个快速、轻量级、开源的PDF解析工具,使用Rust编写,原生支持图像到PDF的转换,并提供带有边界框的空间文本解析,可通过多种包(Rust、Node.js、Python、WASM)使用。

0 人收藏 0 人点赞
#ocr

@vista8: 感觉百度的技术底子还是很硬的。 最近这个Unlimited OCR,竟然连杨立昆(Yann LeCun)都关注到了! Unlimited OCR 提出了 Reference Sliding Window Attention (R-SWA)…

X AI KOLs Timeline · 2026-07-22 缓存

百度开源的Unlimited OCR模型提出Reference Sliding Window Attention(R-SWA)机制,以30亿参数实现数十页文档连续解析,在GitHub和HuggingFace上获得极高关注。

0 人收藏 0 人点赞
#ocr

@VikParuchuri:Marker 由新的 Surya OCR 2 模型驱动(https://github.com/datalab-to/surya…),该模型是在参数量低于 1B 的模型中得分最高的…

X AI KOLs Timeline · 2026-07-21 缓存

Datalab 宣布推出 Surya OCR 2,这是一个 650M 参数的 OCR 模型,在 olmOCR 基准测试中,参数量低于 1B 的模型里取得了最高准确率,同时速度快且支持多语言。

0 人收藏 0 人点赞
#ocr

@VikParuchuri: 在这里获取 marker - https://github.com/datalab-to/marker… 快速开始:pip install marker-pdf,然后 marker /path/to/fold…

X AI KOLs Timeline · 2026-07-21 缓存

Marker 是一个开源工具,可以将 PDF、图像和其他文档格式快速准确地转换为 markdown、JSON、chunks 和 HTML,并可选择使用 LLM 增强。

0 人收藏 0 人点赞
#ocr

DocOCR-Eval:一种无需真实标注、基于校正的OCR工具选择框架

arXiv cs.LG · 2026-07-21 缓存

DocOCR-Eval提出了一种无需标注的框架,采用校正和排序策略,在没有真实标签的情况下评估和选择OCR工具,并表明聚合多个多模态大语言模型能够改善与人工排序的一致性。

0 人收藏 0 人点赞
#ocr

@denziideng: 告别手动截图翻译!overlay-translator 一键触发悬浮窗实时译文,玩游戏看漫画效率直接起飞 玩日服游戏、看日漫总被语言卡住?想实时看懂对话和UI却不想ROOT手机?手动截图翻译又麻烦又断片? 今天分享神器 overlay-t…

X AI KOLs Timeline · 2026-07-21 缓存

Overlay-translator(屏译)是一款开源 Android 实时屏幕翻译工具,无需 ROOT,通过悬浮窗在原画面上叠加中文翻译,支持游戏、漫画、视觉小说等多种场景,集成了多种 OCR 和翻译引擎,可离线使用。

0 人收藏 0 人点赞
#ocr

@DataScienceDojo: 一家中国公司刚刚开源了一个𝐎𝐂𝐑,它修复了大多数AI驱动OCR工具默默挣扎的一个问题:……

X AI KOLs Timeline · 2026-07-20 缓存

Unlimited-OCR,一家中国公司新发布的开源OCR模型,解决了AI OCR工具中常见的内存增长问题——无论文档多长,内存使用都保持平稳,从而能够在32K上下文长度下一次性读取数十页。它采用MIT许可,拥有30亿参数,支持多语言,并且在GitHub上已经广受欢迎。

0 人收藏 0 人点赞
#ocr

@S0N_IA: | 中国已终结OCR业务——一个花生大小的30亿参数模型可以一口气读完整份100页的PDF……

X AI KOLs Timeline · 2026-07-20 缓存

百度发布Unlimited-OCR,一个30亿参数的开源模型,拥有32K上下文窗口,可一口气读完整份100页PDF,准确率达93%,且完全本地运行。该模型在Hugging Face上已有190万下载量,却鲜有关注。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈