@tom_doerr: 将文档和媒体转换为用于LLM的结构化JSON https://github.com/adithya-s-k/omniparse…
摘要
OmniParse是一个本地平台,能够接收和解析非结构化数据(文档、图像、视频、音频、Web),并将其转换为针对LLM应用(如RAG和微调)优化的结构化JSON。
将文档和媒体转换为用于LLM的结构化JSON
https://t.co/Mt55t9Uuvn https://t.co/G5R6rf2eHD
查看缓存全文
缓存时间: 2026/05/26 19:13
API端点
相似文章
@ErickSky:这个仓库是我最近看到的用于 RAG 管道和本地代理的最可靠的东西。[OmniParse] 它几乎能摄取任何……
OmniParse 是一个仓库,几乎能摄取任何文件并将其转换为干净、结构化的 Markdown,完全本地运行,无需外部 API,非常适合 RAG 管道和本地代理。
@tom_doerr: 在本地索引PDF和Markdown文件以进行语义搜索和AI增强。 https://github.com/joelhooks/pdf-brain…
此工具在本地对PDF和Markdown文件进行索引,用于语义搜索和AI增强,使用Ollama进行嵌入和LLM处理,并提供CLI和MCP服务器以便与AI助手集成。
@hasantoxr: 我找到了为LLM时代打造的OCR工具。它叫olmOCR。olmOCR可以处理PDF、扫描件、PNG和JPEG,并将其转…
olmOCR 是来自Ai2的开源OCR工具,能够将PDF、扫描件和图像转换为干净的Markdown格式,旨在通过保留阅读顺序和处理复杂布局,为LLM流水线准备文档。
@hasantoxr: 现在只需一条命令就能将杂乱文档转化为结构化知识。它叫做Hyper-Extract。大多数RAG工具只是…
Hyper-Extract 是一款命令行工具,可将凌乱的非结构化文档转化为结构化知识,如知识图谱、超图、时间/空间图及Obsidian vault,支持本地LLM推理与MCP集成。
@tom_doerr: 将学术论文转换为结构化的Obsidian笔记 https://github.com/917Dhj/DeepPaperNote…
DeepPaperNote 是一个开源工具,可自动将学术论文转换为结构化的Obsidian笔记,处理元数据、图表和笔记生成,以支持深度阅读。