@DanKornas: 你的文本语料库不应该被局限在段落中。kg-gen 是一个用于从…提取知识图谱的 Python 包。

X AI KOLs Timeline 工具

摘要

kg-gen 是一个开源 Python 包,通过语言模型(借助 LiteLLM 和 DSPy)从纯文本或对话消息中提取知识图谱,具备分块、聚类和灵活的路由提供商功能。

你的文本语料库不应该被局限在段落中。 kg-gen 是一个 Python 包,用于从纯文本或对话风格的消息数组中提取知识图谱。 它通过使用语言模型进行结构化抽取,借助 LiteLLM 进行提供商路由,以及 DSPy 生成结构化输出,帮助你将原始文本转换为实体、边标签和关系。 主要功能: • 文本到图谱抽取 – 将字符串转换为实体、关系类型以及主体-关系-客体三元组 • 长文本分块 – 通过 chunk_size 参数将较长的输入拆分成更小的块进行处理 • 实体与关系聚类 – 在生成期间或之后对相似实体和边进行分组 • 消息数组处理 – 处理包含角色/内容的消息,同时保留顺序和边界 • 模型提供商的灵活性 – 通过 LiteLLM 路由调用至 OpenAI、Ollama、Anthropic、Gemini、Deepseek 等 这是一个开源项目(MIT 许可)。 回复中的链接
查看原文
查看缓存全文

缓存时间: 2026/05/21 17:39

您的文本语料不应该被束缚在段落里。

kg-gen 是一个 Python 包,用于从纯文本或对话风格的消息数组中提取知识图谱。

它通过语言模型进行结构化抽取,利用 LiteLLM 进行提供者路由,并通过 DSPy 生成结构化输出,帮助你从原始文本中提取实体、边标签和关系。

主要特点:

• 文本到图谱提取 —— 将字符串转换为实体、关系类型以及主语-关系-宾语三元组 • 大文本分块处理 —— 使用 chunk_size 参数将较长输入切分成小块处理 • 实体与关系聚类 —— 在生成过程中或生成后对相似实体和边进行分组 • 消息数组处理 —— 处理带有角色/内容的消息,同时保持顺序和边界 • 模型提供者灵活性 —— 通过 LiteLLM 路由调用,支持 OpenAI、Ollama、Anthropic、Gemini、Deepseek 等

它是开源的(MIT 许可证)。

链接见回复

相似文章

KG2Cypher:用于构建企业级文本到Cypher系统的数据驱动管道

arXiv cs.CL

KG2Cypher 提出了一种数据驱动管道,利用现有知识图谱构建企业级文本到Cypher系统。它使用LLM生成自然语言问题-Cypher对,并通过LLM评估器和人工审核进行验证,通过基于LoRA的微调在韩语企业数据集上取得了显著的性能提升。