@hasantoxr: 现在只需一条命令就能将杂乱文档转化为结构化知识。它叫做Hyper-Extract。大多数RAG工具只是…

X AI KOLs Timeline 工具

摘要

Hyper-Extract 是一款命令行工具,可将凌乱的非结构化文档转化为结构化知识,如知识图谱、超图、时间/空间图及Obsidian vault,支持本地LLM推理与MCP集成。

现在只需一条命令就能将杂乱文档转化为结构化知识。 它叫做Hyper-Extract。 大多数RAG工具只是将PDF分块,然后寄希望于搜索生效。 Hyper-Extract 做得更疯狂: 它将非结构化文本转化为: • 知识图谱 • 超图 • 时间图 • 空间图 • 时空图 • 强类型数据模型 • Obsidian vault • 支持MCP的知识库 所以,与其让AI“阅读这份报告”,不如将报告转化为一个真正的知识系统。 使用场景: → 将论文转化为研究图谱 → 从财报中提取公司、人员、指标和风险 → 从私有文档构建可搜索的知识库 → 使用vLLM本地运行,让你的数据留在本地 → 通过MCP从Claude Desktop或IDE代理查询提取的知识 它还提供了80多个YAML模板,涵盖金融、法律、医疗、工业和通用领域。 这不仅仅是文档提取。 这是RAG在长出脊梁后的样子。 仓库:https://github.com/yifanfeng97/Hyper-Extract…
查看原文
查看缓存全文

缓存时间: 2026/06/25 13:20

现在只需一条命令,就能将杂乱文档整理为结构化知识。这就是 Hyper-Extract。多数 RAG 工具只是把你的 PDF 分块后希望搜索能生效,而 Hyper-Extract 做的事情更疯狂:它能把非结构化文本转化为: • 知识图谱 • 超图 • 时序图 • 空间图 • 时空图 • 强类型数据模型 • Obsidian 仓库 • MCP 就绪的知识库

所以你不再需要请 AI “读这份报告”,而是可以直接把报告变成一个真正的知识系统。

使用场景: → 将论文变成研究图谱 → 从财报中提取公司、人物、指标和风险 → 把私有文档构建成可搜索的知识库 → 本地运行 vLLM,数据留在自己的机器上 → 通过 MCP 从 Claude Desktop 或 IDE 代理查询提取出的知识

它还内置了 80+ 个 YAML 模板,涵盖金融、法律、医疗、工业和通用领域。

这不只是文档提取。这是 RAG 长出了脊梁后的样子。

仓库:https://github.com/yifanfeng97/Hyper-Extract


yifanfeng97/Hyper-Extract

来源:https://github.com/yifanfeng97/Hyper-Extract

智能知识提取 CLI

一条命令将文档转化为结构化知识。

📖 English Version · 中文版

“停止阅读。开始理解。” “告别文档焦虑,让信息一目了然”

📰 新特性

  • 🔌 MCP 服务器 — 通过 he-mcp 从 Claude Desktop 和 IDE 代理查询你的知识摘要。(PR #40)
  • 🧠 Anthropic Claude 支持 — 直接使用 claude-opus-4-8claude-sonnet-4-6claude-haiku-4-5 作为 LLM 提供商。 (PR #38)
  • 📝 Obsidian 导出 — 将任意图谱转化为 Obsidian 仓库,生成由 [[wikilinks]] 链接的 Markdown 笔记。 (PR #37)
  • 🧹 he clean — 一条命令删除知识摘要的索引或整个知识摘要。 (PR #39)
  • 🔧 可靠性修复 — 多块嵌入使用真正均值、限制 OpenAI 兼容批次大小、解决多词 llm_* 合并策略。 (PRs #35, #36, #41)

完整更新日志请查看 GitHub Releases(https://github.com/yifanfeng97/hyper-extract/releases)。

Hyper-Extract 是一个智能的、由 LLM 驱动的知识提取与进化框架。它从根本上简化了将高度非结构化文本转化为持久、可预测且强类型的知识摘要的过程。它能够轻松将信息提取到多种格式中——从简单的集合(列表/集合)和 Pydantic 模型,到复杂的知识图谱超图,甚至时空图

✨ 核心功能

🔷 8 种知识结构从简单列表到高级图谱、超图及时空图
🧠 10+ 种提取引擎GraphRAG、LightRAG、Hyper-RAG、KG-Gen 等——开箱即用
📝 80+ 个 YAML 模板零代码提取,覆盖金融、法律、医疗、中医、工业和通用领域
🔄 增量演进随时添加新文档来扩展和完善知识库
📤 Obsidian 导出将任意提取的图谱转化为 Obsidian 仓库——Markdown 笔记通过 [[wikilinks]] 连接

🎯 你可以用它做什么?

📄 研究员——将论文转化为知识图谱 输入一份 20 页的学术论文,即可获得关键概念、作者和引用的交互式图谱。

he parse paper.pdf -t general/academic_graph -o ./paper_kb/
he show ./paper_kb/

🏦 金融分析师——从财报中提取实体 自动识别非结构化报告中的公司、高管、财务指标及其关系。

he parse earnings.md -t finance/earnings_graph -o ./finance_kb/
he search ./finance_kb/ "What are the key risk factors?"

🔒 本地部署——使用 vLLM 将数据保留在本地 在本地通过 vLLM 运行 Qwen3.5-9B + bge-m3。数据不会离开你的机器。

pip install hyperextract[vllm]
from hyperextract import create_client
llm, emb = create_client(
    llm="vllm:Qwen3.5-9B@http://localhost:8000/v1",
    embedder="vllm:bge-m3@http://localhost:8001/v1",
    api_key="dummy",
)

🚀 支持平台与模型

Hyper-Extract 依赖 LLM 的结构化输出能力(json_schema 或函数调用)。

平台已验证模型
OpenAIgpt-4o, gpt-4o-mini, gpt-5
Anthropicclaude-opus-4-8, claude-sonnet-4-6, claude-haiku-4-5
阿里云百炼qwen-plus, qwen-turbo, deepseek-r1
本地 vLLMQwen3.5-9B (GPTQ-Marlin)

嵌入模型(语义搜索)适用于任何 OpenAI 兼容端点:text-embedding-3-smalltext-embedding-v4(百炼)、bge-m3(本地 vLLM)。

Anthropic 说明: Claude 用于 LLM(设置 ANTHROPIC_API_KEY)。Anthropic 没有嵌入 API,因此需要搭配 OpenAI 兼容的嵌入器:

from hyperextract import create_client
llm, emb = create_client(llm="anthropic", embedder="openai:text-embedding-3-small")

需要额外安装:pip install 'hyperextract[anthropic]'。 📖 完整指南:提供商系统与本地模型支持(https://yifanfeng97.github.io/Hyper-Extract/latest/concepts/provider-system/)

⚡ 30 秒快速开始

# 安装
pip install hyperextract

# 配置 API 密钥
he config init -k YOUR_OPENAI_API_KEY

# 从文档中提取知识
he parse examples/en/tesla.md -t general/biography_graph -o ./output/ -l en

# 查询
he search ./output/ "What are Tesla's major achievements?"

# 可视化
he show ./output/

# 导出为 Obsidian 仓库(Markdown 笔记 + [[wikilinks]])
he export obsidian ./output/ -o ./vault/

🐍 Python API(点击展开)

pip install hyperextract
from hyperextract import Template
ka = Template.create("general/biography_graph")
with open("examples/en/tesla.md") as f:
    result = ka.parse(f.read())
result.show()

🔗 更多示例:examples/en

📈 为何选择 Hyper-Extract?

功能GraphRAGLightRAGKG-GenATOMHyper-Extract
知识图谱
时序图
空间图
超图
领域模板
交互式 CLI
多语言

🧩 支持的知识结构

从简单到复杂——选择适合你的数据结构:

示例——自动图谱可视化:

(此处原文档有图片,翻译时保留图片占位)

📋 引擎盖下是什么?(架构与模板)

Hyper-Extract 采用三层架构

  • 自动类型 — 8 种强类型数据结构(模型、列表、集合、图谱、超图、时序图、空间图、时空图)
  • 方法 — 提取算法:KG-Gen、GraphRAG、LightRAG、Hyper-RAG、Cog-RAG 等
  • 模板 — 80+ 个预设模板,覆盖 6 个领域。零代码配置。

模板示例(图谱类型):

language: en
name: 知识图谱
type: graph
tags: [general]
description: '提取实体及其关系。'
output:
  entities:
    fields:
      - name: name
        type: str
      - name: type
        type: str
      - name: description
        type: str
  relations:
    fields:
      - name: source
        type: str
      - name: target
        type: str
      - name: type
        type: str
identifiers:
  entity_id: name
  relation_id: '{source}|{type}|{target}'

📚 文档与资源

资源链接
完整文档yifanfeng97.github.io/Hyper-Extract(https://yifanfeng97.github.io/Hyper-Extract/latest/)
CLI 指南命令行界面(https://yifanfeng97.github.io/Hyper-Extract/latest/cli/)
提供商系统模型兼容性与本地部署(https://yifanfeng97.github.io/Hyper-Extract/latest/concepts/provider-system/)
模板库80+ 预设模板
示例可运行代码

🔌 MCP 服务器

通过模型上下文协议(https://modelcontextprotocol.io)将你的知识摘要暴露给支持 MCP 的助手(Claude Desktop、IDE 代理)——仅限读取和导出。

pip install 'hyperextract[mcp]'
he-mcp   # stdio MCP 服务器

工具:list_templatesinfosearchask(RAG)、export_obsidian

完整指南:MCP 服务器文档(https://yifanfeng97.github.io/Hyper-Extract/latest/mcp/)。

🤝 贡献与许可

欢迎贡献!请提交 Issue(https://github.com/yifanfeng97/hyper-extract/issues)和 PR(https://github.com/yifanfeng97/hyper-extract/pulls)。

采用 Apache-2.0 许可。

🔒 安全

本项目已通过 MseeP.ai(https://mseep.ai/app/yifanfeng97-hyper-extract)的安全评估。

AtomGit 镜像

AtomGit 镜像——Agent Reach 的同步镜像,方便国内用户访问和克隆。托管在 AtomGit:https://atomgit.com/yifanfeng97/Hyper-Extract

相似文章

yifanfeng97/Hyper-Extract

GitHub Trending (daily)

Hyper-Extract 是一个开源命令行工具,利用大语言模型(LLMs)从非结构化文档中提取结构化知识,支持多种输出格式,如知识图谱和超图。

@TechFlow99: 突发:有人刚刚构建了 Andrej Karpathy 说应该有人去构建的工具。就在 Karpathy 发帖后 48 小时……

X AI KOLs Timeline

一款名为 Graphify 的新开源工具在 Andrej Karpathy 描述 LLM 知识库工作流后 48 小时内诞生。它能从任意文件夹生成可导航的知识图谱、Obsidian 知识库和 Wiki,与直接读取原始文件相比,每次查询所需 token 减少了 71.5 倍。该工具可与 Claude Code 集成,支持 13 种编程语言、PDF、图片和 Markdown。