pdf-processing

标签

Cards List
#pdf-processing

@GYLQ520: PixelRAG 来自伯克利 SkyLab 等团队,开源可玩。 它的思路很直接,不再靠 HTML 或文本解析,而是把网页、PDF 直接截成截图,用视觉索引做 RAG 检索。 表格、图表、布局这些 HTML 解析会丢掉的东西,全保留下来了。…

X AI KOLs Timeline · 2026-08-21 缓存

PixelRAG 是来自伯克利SkyLab等团队的开源项目,通过将网页和PDF截图为截图并用视觉索引进行检索,提高RAG准确率并显著降低AI Agent的token成本。

0 人收藏 0 人点赞
#pdf-processing

@googledevs:静态PDF交互式网络应用,通过单个提示实现!我们在@GoogleAIStudio中使用Gemini 3.7 Flash转换一份密集的PDF……

X AI KOLs Timeline · 2026-08-18 缓存

Google Developers展示了在Google AI Studio中使用Gemini 3.7 Flash将PDF年度报告转换为交互式网络应用,突出了模型通过单个提示的数据提取和UI生成能力。

0 人收藏 0 人点赞
#pdf-processing

@googleaidevs: 我们向Gemini 3.7 Flash提供了数百份来自维多利亚时代植物图鉴的PDF,并让其提取……

X AI KOLs Timeline · 2026-08-17 缓存

Google AI Devs 利用Gemini 3.7 Flash从历史植物PDF中提取和分类植物,并通过交互式可视化进行演示。

0 人收藏 0 人点赞
#pdf-processing

@sunmer575399: Stirling-PDF这项目把自动化玩明白了,89.0k star实打实 50多种PDF工具全塞进一个开源平台,合并、拆分、压缩、OCR、加水印,基本覆盖日常所有需求 最狠的是自动化pipeline,拖拽节点就能批量处理PDF,不用写一…

X AI KOLs Timeline · 2026-08-08 缓存

Stirling-PDF是一个开源PDF处理平台,提供50多种工具(合并、拆分、OCR、压缩等),支持浏览器、Docker自托管和REST API,并支持无代码自动化pipeline。该项目在GitHub上有89k+ star,可完全本地部署,保护隐私。

0 人收藏 0 人点赞
#pdf-processing

@sitinme: 不“让 AI 总结一本书”,而是更进一步:把一本书、一个文档包,整理成 AI Agent 可以反复调用的 Skill,这个思路感觉可以聊一聊。 之前书买了、读了,过一阵想找里面某个知识点,翻半天找不到;问 AI 吧,它可能瞎编;把整本 P…

X AI KOLs Timeline · 2026-06-05 缓存

介绍了一个将书籍或文档包转换为AI Agent可调用Skill的工具book-to-skill,支持PDF等格式,生成SKILL.md和章节索引,避免一次性加载全部上下文。

0 人收藏 0 人点赞
#pdf-processing

具备视觉能力的LLM与OCR在长文档(包括图表、图片、表格等)问答中的对比

Reddit r/artificial · 2026-05-24

一项对比测试,将具备视觉能力的LLM(原生PDF阅读模式)与基于OCR的流程在30份长且图片密集的PDF上进行比较,发现带有布局提取的OCR在图表/表格密集的页面上仍优于视觉模型,且失败率为0%,而原生PDF为7%,尽管样本量较小且许多差距在噪声范围内。

0 人收藏 0 人点赞
#pdf-processing

@wsl8297: 如果你手里有一堆 PDF、文档、项目资料要喂给 AI,Synthadoc 这个方向很值得看。 GitHub:https://github.com/axoviq-ai/synthadoc… 它把原始资料在摄入时就编译成结构化 wiki,自动…

X AI KOLs Timeline · 2026-05-23 缓存

Synthadoc 是一个开源工具,可将 PDF、文档等项目资料编译为结构化的本地 Markdown wiki,自动建立交叉引用并检测矛盾,适合个人或小团队进行离线知识管理。

0 人收藏 0 人点赞
#pdf-processing

@tom_doerr: 将技术书籍转化为 Claude Code 技能 https://github.com/virgiliojr94/book-to-skill…

X AI KOLs Timeline · 2026-05-22 缓存

book-to-skill 将技术书籍转换为适用于 Claude Code 的结构化技能,支持按需参考并消除幻觉。

0 人收藏 0 人点赞
#pdf-processing

olmOCR:利用视觉语言模型解锁PDF中的数万亿Token

Papers with Code Trending · 2025-02-25 缓存

olmOCR 是一个开源工具包,使用微调的视觉语言模型从PDF中提取干净的文本,同时保留结构,并针对大规模批处理进行了优化。

0 人收藏 0 人点赞
#pdf-processing

opendatalab/MinerU

GitHub Trending (daily) · 2026-06-25 缓存

MinerU 是 OpenDataLab 开发的一款开源工具,用于从 PDF 和文档中提取数据。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈