@DanKornas: 你的文本语料库不应该被局限在段落中。kg-gen 是一个用于从…提取知识图谱的 Python 包。
摘要
kg-gen 是一个开源 Python 包,通过语言模型(借助 LiteLLM 和 DSPy)从纯文本或对话消息中提取知识图谱,具备分块、聚类和灵活的路由提供商功能。
查看缓存全文
缓存时间: 2026/05/21 17:39
您的文本语料不应该被束缚在段落里。
kg-gen 是一个 Python 包,用于从纯文本或对话风格的消息数组中提取知识图谱。
它通过语言模型进行结构化抽取,利用 LiteLLM 进行提供者路由,并通过 DSPy 生成结构化输出,帮助你从原始文本中提取实体、边标签和关系。
主要特点:
• 文本到图谱提取 —— 将字符串转换为实体、关系类型以及主语-关系-宾语三元组 • 大文本分块处理 —— 使用 chunk_size 参数将较长输入切分成小块处理 • 实体与关系聚类 —— 在生成过程中或生成后对相似实体和边进行分组 • 消息数组处理 —— 处理带有角色/内容的消息,同时保持顺序和边界 • 模型提供者灵活性 —— 通过 LiteLLM 路由调用,支持 OpenAI、Ollama、Anthropic、Gemini、Deepseek 等
它是开源的(MIT 许可证)。
链接见回复
相似文章
KG2Cypher:用于构建企业级文本到Cypher系统的数据驱动管道
KG2Cypher 提出了一种数据驱动管道,利用现有知识图谱构建企业级文本到Cypher系统。它使用LLM生成自然语言问题-Cypher对,并通过LLM评估器和人工审核进行验证,通过基于LoRA的微调在韩语企业数据集上取得了显著的性能提升。
@DataChaz: 混乱文档输入,复杂知识图谱输出,仅需一条命令行。如果你的流水线只是将数据编译成通用……
Hyper-Extract 是一个开源框架,可将混乱文档转换为类型化知识结构,支持多种图谱架构(如 GraphRAG、LightRAG 和 KG-Gen),拥有 10 多种提取引擎和 80 多个面向不同领域的 YAML 模板。
@DanKornas: 构建知识库代理,无需从向量数据库开始 知识代理模板是一个开源的文件系统…
一个开源的知识代理模板,通过使用基于文件的搜索(grep、find、cat)避免向量数据库,并支持多种平台,如网页聊天、GitHub和Discord机器人。
@DanKornas: 智能体教程嘈杂混乱。这个仓库为你指明方向。LangGraph 101 是一个动手实践的教程仓库,用于学习 LangCha…
LangGraph 101 是一个开源教程仓库,通过笔记本和可运行的智能体示例来学习 LangChain、LangGraph 和 Deep Agents,内容分为基础路线和生产模式路线。
@AlphaSignalAI: LLM 知识库 最近我发现非常有用的东西:使用 LLM 为各种研究兴趣主题构建个人知识库...
Google 的开放知识格式(OKF)提出了一种可移植的组织知识标准,帮助 AI 代理检索正确的上下文,解决了数据目录、维基和代码之间的碎片化问题。