@hasantoxr: 现在只需一条命令就能将杂乱文档转化为结构化知识。它叫做Hyper-Extract。大多数RAG工具只是…
摘要
Hyper-Extract 是一款命令行工具,可将凌乱的非结构化文档转化为结构化知识,如知识图谱、超图、时间/空间图及Obsidian vault,支持本地LLM推理与MCP集成。
查看缓存全文
缓存时间: 2026/06/25 13:20
现在只需一条命令,就能将杂乱文档整理为结构化知识。这就是 Hyper-Extract。多数 RAG 工具只是把你的 PDF 分块后希望搜索能生效,而 Hyper-Extract 做的事情更疯狂:它能把非结构化文本转化为: • 知识图谱 • 超图 • 时序图 • 空间图 • 时空图 • 强类型数据模型 • Obsidian 仓库 • MCP 就绪的知识库
所以你不再需要请 AI “读这份报告”,而是可以直接把报告变成一个真正的知识系统。
使用场景: → 将论文变成研究图谱 → 从财报中提取公司、人物、指标和风险 → 把私有文档构建成可搜索的知识库 → 本地运行 vLLM,数据留在自己的机器上 → 通过 MCP 从 Claude Desktop 或 IDE 代理查询提取出的知识
它还内置了 80+ 个 YAML 模板,涵盖金融、法律、医疗、工业和通用领域。
这不只是文档提取。这是 RAG 长出了脊梁后的样子。
仓库:https://github.com/yifanfeng97/Hyper-Extract
yifanfeng97/Hyper-Extract
来源:https://github.com/yifanfeng97/Hyper-Extract
智能知识提取 CLI
一条命令将文档转化为结构化知识。
“停止阅读。开始理解。” “告别文档焦虑,让信息一目了然”
📰 新特性
- 🔌 MCP 服务器 — 通过
he-mcp从 Claude Desktop 和 IDE 代理查询你的知识摘要。(PR #40) - 🧠 Anthropic Claude 支持 — 直接使用
claude-opus-4-8、claude-sonnet-4-6和claude-haiku-4-5作为 LLM 提供商。 (PR #38) - 📝 Obsidian 导出 — 将任意图谱转化为 Obsidian 仓库,生成由
[[wikilinks]]链接的 Markdown 笔记。 (PR #37) - 🧹
he clean— 一条命令删除知识摘要的索引或整个知识摘要。 (PR #39) - 🔧 可靠性修复 — 多块嵌入使用真正均值、限制 OpenAI 兼容批次大小、解决多词
llm_*合并策略。 (PRs #35, #36, #41)
完整更新日志请查看 GitHub Releases(https://github.com/yifanfeng97/hyper-extract/releases)。
Hyper-Extract 是一个智能的、由 LLM 驱动的知识提取与进化框架。它从根本上简化了将高度非结构化文本转化为持久、可预测且强类型的知识摘要的过程。它能够轻松将信息提取到多种格式中——从简单的集合(列表/集合)和 Pydantic 模型,到复杂的知识图谱、超图,甚至时空图。
✨ 核心功能
| 🔷 8 种知识结构 | 从简单列表到高级图谱、超图及时空图 | |
| 🧠 10+ 种提取引擎 | GraphRAG、LightRAG、Hyper-RAG、KG-Gen 等——开箱即用 | |
| 📝 80+ 个 YAML 模板 | 零代码提取,覆盖金融、法律、医疗、中医、工业和通用领域 | |
| 🔄 增量演进 | 随时添加新文档来扩展和完善知识库 | |
| 📤 Obsidian 导出 | 将任意提取的图谱转化为 Obsidian 仓库——Markdown 笔记通过 [[wikilinks]] 连接 |
🎯 你可以用它做什么?
📄 研究员——将论文转化为知识图谱 输入一份 20 页的学术论文,即可获得关键概念、作者和引用的交互式图谱。
he parse paper.pdf -t general/academic_graph -o ./paper_kb/
he show ./paper_kb/
🏦 金融分析师——从财报中提取实体 自动识别非结构化报告中的公司、高管、财务指标及其关系。
he parse earnings.md -t finance/earnings_graph -o ./finance_kb/
he search ./finance_kb/ "What are the key risk factors?"
🔒 本地部署——使用 vLLM 将数据保留在本地 在本地通过 vLLM 运行 Qwen3.5-9B + bge-m3。数据不会离开你的机器。
pip install hyperextract[vllm]
from hyperextract import create_client
llm, emb = create_client(
llm="vllm:Qwen3.5-9B@http://localhost:8000/v1",
embedder="vllm:bge-m3@http://localhost:8001/v1",
api_key="dummy",
)
🚀 支持平台与模型
Hyper-Extract 依赖 LLM 的结构化输出能力(json_schema 或函数调用)。
| 平台 | 已验证模型 |
|---|---|
| OpenAI | gpt-4o, gpt-4o-mini, gpt-5 |
| Anthropic | claude-opus-4-8, claude-sonnet-4-6, claude-haiku-4-5 |
| 阿里云百炼 | qwen-plus, qwen-turbo, deepseek-r1 |
| 本地 vLLM | Qwen3.5-9B (GPTQ-Marlin) |
嵌入模型(语义搜索)适用于任何 OpenAI 兼容端点:text-embedding-3-small、text-embedding-v4(百炼)、bge-m3(本地 vLLM)。
Anthropic 说明: Claude 用于 LLM(设置
ANTHROPIC_API_KEY)。Anthropic 没有嵌入 API,因此需要搭配 OpenAI 兼容的嵌入器:from hyperextract import create_client llm, emb = create_client(llm="anthropic", embedder="openai:text-embedding-3-small")需要额外安装:
pip install 'hyperextract[anthropic]'。 📖 完整指南:提供商系统与本地模型支持(https://yifanfeng97.github.io/Hyper-Extract/latest/concepts/provider-system/)
⚡ 30 秒快速开始
# 安装
pip install hyperextract
# 配置 API 密钥
he config init -k YOUR_OPENAI_API_KEY
# 从文档中提取知识
he parse examples/en/tesla.md -t general/biography_graph -o ./output/ -l en
# 查询
he search ./output/ "What are Tesla's major achievements?"
# 可视化
he show ./output/
# 导出为 Obsidian 仓库(Markdown 笔记 + [[wikilinks]])
he export obsidian ./output/ -o ./vault/
🐍 Python API(点击展开)
pip install hyperextract
from hyperextract import Template
ka = Template.create("general/biography_graph")
with open("examples/en/tesla.md") as f:
result = ka.parse(f.read())
result.show()
🔗 更多示例:examples/en
📈 为何选择 Hyper-Extract?
| 功能 | GraphRAG | LightRAG | KG-Gen | ATOM | Hyper-Extract |
|---|---|---|---|---|---|
| 知识图谱 | ✅ | ✅ | ✅ | ✅ | ✅ |
| 时序图 | ✅ | ❌ | ❌ | ✅ | ✅ |
| 空间图 | ❌ | ❌ | ❌ | ❌ | ✅ |
| 超图 | ❌ | ❌ | ❌ | ❌ | ✅ |
| 领域模板 | ❌ | ❌ | ❌ | ❌ | ✅ |
| 交互式 CLI | ✅ | ❌ | ❌ | ❌ | ✅ |
| 多语言 | ✅ | ❌ | ❌ | ❌ | ✅ |
🧩 支持的知识结构
从简单到复杂——选择适合你的数据结构:
示例——自动图谱可视化:
(此处原文档有图片,翻译时保留图片占位)
📋 引擎盖下是什么?(架构与模板)
Hyper-Extract 采用三层架构:
- 自动类型 — 8 种强类型数据结构(模型、列表、集合、图谱、超图、时序图、空间图、时空图)
- 方法 — 提取算法:KG-Gen、GraphRAG、LightRAG、Hyper-RAG、Cog-RAG 等
- 模板 — 80+ 个预设模板,覆盖 6 个领域。零代码配置。
模板示例(图谱类型):
language: en
name: 知识图谱
type: graph
tags: [general]
description: '提取实体及其关系。'
output:
entities:
fields:
- name: name
type: str
- name: type
type: str
- name: description
type: str
relations:
fields:
- name: source
type: str
- name: target
type: str
- name: type
type: str
identifiers:
entity_id: name
relation_id: '{source}|{type}|{target}'
📚 文档与资源
| 资源 | 链接 |
|---|---|
| 完整文档 | yifanfeng97.github.io/Hyper-Extract(https://yifanfeng97.github.io/Hyper-Extract/latest/) |
| CLI 指南 | 命令行界面(https://yifanfeng97.github.io/Hyper-Extract/latest/cli/) |
| 提供商系统 | 模型兼容性与本地部署(https://yifanfeng97.github.io/Hyper-Extract/latest/concepts/provider-system/) |
| 模板库 | 80+ 预设模板 |
| 示例 | 可运行代码 |
🔌 MCP 服务器
通过模型上下文协议(https://modelcontextprotocol.io)将你的知识摘要暴露给支持 MCP 的助手(Claude Desktop、IDE 代理)——仅限读取和导出。
pip install 'hyperextract[mcp]'
he-mcp # stdio MCP 服务器
工具:list_templates、info、search、ask(RAG)、export_obsidian。
完整指南:MCP 服务器文档(https://yifanfeng97.github.io/Hyper-Extract/latest/mcp/)。
🤝 贡献与许可
欢迎贡献!请提交 Issue(https://github.com/yifanfeng97/hyper-extract/issues)和 PR(https://github.com/yifanfeng97/hyper-extract/pulls)。
采用 Apache-2.0 许可。
🔒 安全
本项目已通过 MseeP.ai(https://mseep.ai/app/yifanfeng97-hyper-extract)的安全评估。
AtomGit 镜像
AtomGit 镜像——Agent Reach 的同步镜像,方便国内用户访问和克隆。托管在 AtomGit:https://atomgit.com/yifanfeng97/Hyper-Extract
相似文章
@so_ainsight: 杂乱的文档,一条命令即可转化为结构化知识。向AI喂文档时,一个隐秘的难题是...
Hyper-Extract 是一款 Apache 2.0 开源工具,能将非结构化文档转换为结构化知识库,支持知识图谱、时间序列数据、空间信息,实现高精度AI查询。
@DataChaz: 混乱文档输入,复杂知识图谱输出,仅需一条命令行。如果你的流水线只是将数据编译成通用……
Hyper-Extract 是一个开源框架,可将混乱文档转换为类型化知识结构,支持多种图谱架构(如 GraphRAG、LightRAG 和 KG-Gen),拥有 10 多种提取引擎和 80 多个面向不同领域的 YAML 模板。
yifanfeng97/Hyper-Extract
Hyper-Extract 是一个开源命令行工具,利用大语言模型(LLMs)从非结构化文档中提取结构化知识,支持多种输出格式,如知识图谱和超图。
@tom_doerr: 将文档和媒体转换为用于LLM的结构化JSON https://github.com/adithya-s-k/omniparse…
OmniParse是一个本地平台,能够接收和解析非结构化数据(文档、图像、视频、音频、Web),并将其转换为针对LLM应用(如RAG和微调)优化的结构化JSON。
@TechFlow99: 突发:有人刚刚构建了 Andrej Karpathy 说应该有人去构建的工具。就在 Karpathy 发帖后 48 小时……
一款名为 Graphify 的新开源工具在 Andrej Karpathy 描述 LLM 知识库工作流后 48 小时内诞生。它能从任意文件夹生成可导航的知识图谱、Obsidian 知识库和 Wiki,与直接读取原始文件相比,每次查询所需 token 减少了 71.5 倍。该工具可与 Claude Code 集成,支持 13 种编程语言、PDF、图片和 Markdown。