标签
一位用户分享了对一款轻薄、基于 Android 的设备的实机感受,该设备具备麦克风、扬声器、OCR、文字转语音和 ChatGPT 5.2 聊天功能,并指出其唯一明显的缺点是缺少彩色。
NVIDIA 发布 Nemotron Parse 2.0,这是一个文档图像解析模型,可将扫描的 PDF 和图像转换为带有布局、边界框和阅读顺序的结构化文本,并增加了多语言 OCR 改进和图表感知解析功能。
一项基准测试比较了8款PDF解析器在14项能力上的表现,发现Chandra最准确,同时也指出了速度等方面的权衡;LightOnOCR-1B以小体积令人印象深刻,但在无法辨认的文本上会产生幻觉。
Xberg 是一个本地内容智能框架(Rust 核心,MIT 许可),通过 MCP 服务器或 CLI 从 101 种文档格式中提取文本,重建阅读顺序和表格,并为上下文窗口分块——所有操作均在设备端完成,服务于 AI 智能体。
一位开发者对三种PDF解析模型(MinerU、Granite-Docling、PaddleOCR-VL)在六种文档类型和十二项能力上进行了基准测试,发现MinerU会丢失页脚,除非重建其markdown,而Granite-Docling输出更干净的原生markdown表格。
llm_aided_ocr 是一个 GitHub 项目,它对扫描的 PDF 执行 OCR,并使用 LLM 来纠正和改进提取的文本。
Klartext 是一款免费、注重隐私的在线工具,可将 PDF、扫描件、照片、Word、Excel 和 PowerPoint 文件转换为 Markdown(以及 JSON),整个过程完全在其自有服务器上进行,24 小时后自动删除,且不依赖任何外部 AI/OCR 服务。
本文介绍了IDP AutoOpt,一个自主的LLM智能体,用于优化智能文档处理流水线配置,以更低的成本达到或超过人类专家的准确率,并将配置时间从数周缩短至两小时以内。
一个完全离线的AI使用OCR和向量数据库读取了超过4000页解密的UFO文件,在本地提供带引用的答案,无需云端或API密钥。
一位开发者描述了构建PDF分类工具的过程,该工具通过检查PDF结构来判断其包含文本层还是由扫描图像组成,从而避免静默的空提取失败,并分享了关于虚假文本检测和幻影表格的陷阱。
本文揭示了视觉语言模型在面对错别字或视觉伪影等扰动时,往往会改写文本而非忠实转录,并引入了 FaithC4 基准来评估多种模型和语言中的这种行为。
LiteParse是一个快速、轻量级、开源的PDF解析工具,使用Rust编写,原生支持图像到PDF的转换,并提供带有边界框的空间文本解析,可通过多种包(Rust、Node.js、Python、WASM)使用。
百度开源的Unlimited OCR模型提出Reference Sliding Window Attention(R-SWA)机制,以30亿参数实现数十页文档连续解析,在GitHub和HuggingFace上获得极高关注。
Datalab 宣布推出 Surya OCR 2,这是一个 650M 参数的 OCR 模型,在 olmOCR 基准测试中,参数量低于 1B 的模型里取得了最高准确率,同时速度快且支持多语言。
Marker 是一个开源工具,可以将 PDF、图像和其他文档格式快速准确地转换为 markdown、JSON、chunks 和 HTML,并可选择使用 LLM 增强。
DocOCR-Eval提出了一种无需标注的框架,采用校正和排序策略,在没有真实标签的情况下评估和选择OCR工具,并表明聚合多个多模态大语言模型能够改善与人工排序的一致性。
Overlay-translator(屏译)是一款开源 Android 实时屏幕翻译工具,无需 ROOT,通过悬浮窗在原画面上叠加中文翻译,支持游戏、漫画、视觉小说等多种场景,集成了多种 OCR 和翻译引擎,可离线使用。
Unlimited-OCR,一家中国公司新发布的开源OCR模型,解决了AI OCR工具中常见的内存增长问题——无论文档多长,内存使用都保持平稳,从而能够在32K上下文长度下一次性读取数十页。它采用MIT许可,拥有30亿参数,支持多语言,并且在GitHub上已经广受欢迎。
百度发布Unlimited-OCR,一个30亿参数的开源模型,拥有32K上下文窗口,可一口气读完整份100页PDF,准确率达93%,且完全本地运行。该模型在Hugging Face上已有190万下载量,却鲜有关注。