ocr

标签

Cards List
#ocr

@jerryjliu0: Opus 5.5 是解析 PDF 表格的最佳前沿模型。我们通过 ParseBench 测试,得分 93.9%,比 Opus 5 提高了 7% 以上…

X AI KOLs Timeline · 昨天 缓存

Opus 5.5 在 ParseBench 上针对 PDF 表格解析的得分为 93.9%,超越了 Opus 5 和其他模型,但与 LlamaParse 相比成本较高。

0 人收藏 0 人点赞
#ocr

@jerryjliu0: DocJev 是分类和拆分复杂文档包的最快方法。(默认完全免费且开源!)我……

X AI KOLs Timeline · 昨天 缓存

DocJev 是一个免费、开源的 Python 工具,用于分类和拆分复杂文档包,支持 PDF、DOCX 和 PPTX,并可选择 OCR。

0 人收藏 0 人点赞
#ocr

@jerryjliu0: 介绍 DocJev - 一个使用 jev 的超快开源库,用于文档分类和分割。提供文档 al…

X AI KOLs Timeline · 3天前 缓存

DocJev 是一个使用 Jev 的超快开源库,用于文档分类和分割,支持 OCR 后端如 liteparse 和 LlamaParse,声称比 GPT-5.6-luna 快 6 倍且准确率相当。

0 人收藏 0 人点赞
#ocr

@jerryjliu0: 我们评估了100多个模型在文档解析上的表现,涵盖前沿VLMs、开源权重VLMs、OCR工具和OSS解析器,请查看p…

X AI KOLs Timeline · 4天前 缓存

对超过100个模型在文档解析方面的评估,涵盖前沿VLMs、开源权重VLMs、OCR工具和开源解析器,结果通过parsebench分享。

0 人收藏 0 人点赞
#ocr

@XAMTO_AI:长PDF被切割成单页然后重新拼接,其中跨页表格和阅读顺序最容易……

X AI KOLs Timeline · 5天前 缓存

百度的开源Unlimited-OCR模型同时处理多个PDF页面,优于DeepSeek-OCR等基线模型,并支持本地执行与社区集成。

0 人收藏 0 人点赞
#ocr

@HuggingModels: OCR刚刚经历了一次重大升级。jina-ocr-v1是一款专为文档智能设计的多模态视觉语言模型。它 rea…

X AI KOLs Timeline · 5天前 缓存

Jina-ocr-v1是一款专为高级文档智能设计的多模态视觉语言模型,能够从多语言图像中读取文本。

0 人收藏 0 人点赞
#ocr

PeekPaste

Product Hunt · 2026-09-15 缓存

PeekPaste 是 Mac 上的原生剪贴板管理器,提供轻松访问剪贴板历史记录的功能,包括搜索、OCR 和整理,所有数据均本地存储以保护隐私。

0 人收藏 0 人点赞
#ocr

Thoughts for Mac

Product Hunt · 2026-09-14 缓存

Thoughts for Mac 是一款菜单栏应用程序,支持使用文本、图像和语音快速记笔记,并具有AI驱动的音频转录和文本转换功能。

0 人收藏 0 人点赞
#ocr

Harbor

Product Hunt · 2026-09-14 缓存

Harbor 是一款隐私优先的笔记应用,作为 Evernote 的替代品,具备 OCR 和手写搜索功能,支持跨多个设备使用,并采用价格锁定的订阅模式。

0 人收藏 0 人点赞
#ocr

寻求多文档ERP系统OCR模型选型的建议

Reddit r/AI_Agents · 2026-09-08

作者正在为处理多种语言、手写文本及复杂扫描格式的多文档ERP系统挑选OCR模型,希望得到有实际文档OCR项目经验人士的建议。

0 人收藏 0 人点赞
#ocr

Picolibrary:一家小型出版机构

Hacker News Top · 2026-09-05 缓存

本文介绍了如何利用人工智能工具进行光学字符识别及合同起草,从而重新出版书籍,同时重点阐述了在格式处理及特殊文本元素处理方面所面临的挑战。

0 人收藏 0 人点赞
#ocr

@jerryjliu0:我们在过去约 3 个月里全面大幅提升了文档解析能力。我们的 LlamaParse 成本……

X AI KOLs Timeline · 2026-09-04 缓存

LlamaIndex 在过去三个月里显著改进了 LlamaParse。在 ParseBench 基准测试中,其在复杂表格、图表和 grounding 方面的准确率提升了 10%–20%,同时每页成本仍控制在 0.4 美分以下。

0 人收藏 0 人点赞
#ocr

Jina-OCR-v1:采用推测解码与密集可验证奖励的高效文档解析

arXiv cs.CL · 2026-09-04 缓存

Jina-OCR-v1 是一款高效的端到端文档解析模型,通过结合推测解码与密集可验证奖励技术,可在低预算 GPU 上实现高精度与高处理速度,在 OmniDocBench v1.6 上得分 91.14,olmOCR-Bench 上得分 83.4。

0 人收藏 0 人点赞
#ocr

多模态大语言模型真的理解低资源高棉文档吗?关于高棉文档视觉问答的一项初步研究

arXiv cs.CL · 2026-09-01 缓存

本文评估了开放多模态大语言模型在高棉文档视觉问答上的性能,发现虽然模型在处理英语和数字内容方面表现良好,但理解原生高棉脚本仍然具有挑战性。该研究使用了KH-FUNSD集合中的诊断子集,并比较了不同的模型配置。

0 人收藏 0 人点赞
#ocr

HSK Manga:将漫画转化为初学者中文水平

Lobsters Hottest · 2026-08-30 缓存

HSK Manga是一款免费工具,通过AI和OCR技术将漫画对话简化为适合中文学习者的HSK水平,使阅读对初学者更容易。

0 人收藏 0 人点赞
#ocr

介绍Parse:大规模企业文档智能(5分钟阅读)

TLDR AI · 2026-08-28 缓存

Cohere推出了Parse,这是一种经济高效的视觉语言模型,用于处理大量企业文档并将其转化为结构化数据,为RAG和文档索引等用例提供高性能和可扩展性。

0 人收藏 0 人点赞
#ocr

@nickscamara_: 在AnyDoc中引入OCR 现在你的代理可以免费读取扫描文档 → 非OCR处理时间低于5毫秒 → 每页OCR处理时间中位数190毫秒…

X AI KOLs Timeline · 2026-08-27 缓存

AnyDoc现在包含OCR功能,可用于读取扫描文档,提供快速处理时间和通过Firecrawl的免费托管选项。

0 人收藏 0 人点赞
#ocr

OpenCode Senses:专为 OpenCode 打造的真正理解图像的高级本地视觉插件

Reddit r/LocalLLaMA · 2026-08-27

OpenCode Senses 是一款专为 OpenCode 设计的本地视觉插件,提供先进的图像理解功能,如 OCR、物体检测和颜色分析,完全在本地硬件上私密运行,无需 API 密钥。

0 人收藏 0 人点赞
#ocr

一个恢复 Kindle 导出受限高亮的 Claude Code 技能

Hacker News Top · 2026-08-24 缓存

一个 Claude Code 插件,通过在 macOS 上从 Amazon 的笔记本和 Kindle 应用数据中逐字提取,来恢复 Kindle 导出受限的高亮。

0 人收藏 0 人点赞
#ocr

OCR It – 从无法复制的文档中提取文本,为您的 LLM 服务

Hacker News Top · 2026-08-24 缓存

OCR It 是一款 Chrome 扩展,使用本地 OCR 从无法复制的文档中提取文本,旨在帮助用户为 Claude 或 ChatGPT 等 LLM 准备内容。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈