标签
PixelRAG 是来自伯克利SkyLab等团队的开源项目,通过将网页和PDF截图为截图并用视觉索引进行检索,提高RAG准确率并显著降低AI Agent的token成本。
Google Developers展示了在Google AI Studio中使用Gemini 3.7 Flash将PDF年度报告转换为交互式网络应用,突出了模型通过单个提示的数据提取和UI生成能力。
Google AI Devs 利用Gemini 3.7 Flash从历史植物PDF中提取和分类植物,并通过交互式可视化进行演示。
Stirling-PDF是一个开源PDF处理平台,提供50多种工具(合并、拆分、OCR、压缩等),支持浏览器、Docker自托管和REST API,并支持无代码自动化pipeline。该项目在GitHub上有89k+ star,可完全本地部署,保护隐私。
介绍了一个将书籍或文档包转换为AI Agent可调用Skill的工具book-to-skill,支持PDF等格式,生成SKILL.md和章节索引,避免一次性加载全部上下文。
一项对比测试,将具备视觉能力的LLM(原生PDF阅读模式)与基于OCR的流程在30份长且图片密集的PDF上进行比较,发现带有布局提取的OCR在图表/表格密集的页面上仍优于视觉模型,且失败率为0%,而原生PDF为7%,尽管样本量较小且许多差距在噪声范围内。
Synthadoc 是一个开源工具,可将 PDF、文档等项目资料编译为结构化的本地 Markdown wiki,自动建立交叉引用并检测矛盾,适合个人或小团队进行离线知识管理。
book-to-skill 将技术书籍转换为适用于 Claude Code 的结构化技能,支持按需参考并消除幻觉。
olmOCR 是一个开源工具包,使用微调的视觉语言模型从PDF中提取干净的文本,同时保留结构,并针对大规模批处理进行了优化。