CodeGraph:基于维基数据的开放分类源代码知识图谱
摘要
本文介绍了CodeGraph,一个用于源代码的大规模开放分类知识图谱,使用专用LLM构建并基于维基数据对齐,覆盖数百万文件和实体。
查看缓存全文
缓存时间: 2026/09/28 16:05
论文页面 - CodeGraph:基于Wikidata锚定的源代码开放分类知识图谱
来源:https://huggingface.co/papers/2609.29474
摘要
公共软件仓库(如GitHub和Software Heritage Archive)存储着数十亿文件,然而提取其中隐含的工程知识——即它们实现的算法、遵循的范式、实例化的模式以及服务的应用领域——仍然具有挑战性,因为现有工具仅限于语法和标记层面的分析。本文提出一种利用代码专用大语言模型构建源代码开放分类语义标注的流程。提取的实体通过三阶段链接过程锚定到Wikidata:确定性SPARQL阶段处理无歧义实体,深度研究智能体解决剩余的长尾实体,层级归并阶段导入每个已解析Wikidata标识符的父级闭包。最终生成的标注被构建为面向源代码的开放分类知识图谱。我们进一步引入一种校准化质量保障协议,通过结合少量人工黄金集和LLM评判过滤器来量化标注精度。我们将此流程应用于包含1.67亿文件的Stack-Edu语料库,创建了首个已知的大规模源代码开放分类知识图谱。该图谱名为CodeGraph,包含约1.58亿节点,其中包括约1.45亿文件、约6.3万个提取的概念实体(如算法、范式、设计模式和应用领域),以及约1.98万个锚定的Wikidata实体。此外,CodeGraph具有约10亿条类型边,这些边将文件连接到相应概念,将这些概念链接到其Wikidata标识符,并关联到父级分类,覆盖14种编程语言。
查看arXiv页面 (https://arxiv.org/abs/2609.29474) 查看PDF (https://arxiv.org/pdf/2609.29474) GitHub0 (https://github.com/halykoss/CodeGraph) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.29474)
引用此论文的模型0
没有模型链接此论文
在模型README.md中引用arxiv.org/abs/2609.29474可从此页面链接。
引用此论文的数据集1
halykoss/CodeGraph 查看器• 3天前更新 • 1.18B • 4.88k (https://huggingface.co/datasets/halykoss/CodeGraph)
引用此论文的Spaces0
没有Space链接此论文
在Space README.md中引用arxiv.org/abs/2609.29474可从此页面链接。
包含此论文的收藏夹0
没有收藏夹包含此论文
将此论文添加到收藏夹 (https://huggingface.co/new-collection) 可从此页面链接。
相似文章
colbymchenry/codegraph
CodeGraph 是一个开源工具,为代码库创建预索引的知识图谱,使 Claude Code 的探索代理能够即时查询符号关系和调用图,将工具调用次数减少高达 96%,探索时间减少 77%。
@cathrynlavery: 已经开始在项目中使用 codegraph。它会构建一个包含所有符号、函数和连接的本地知识图谱…
Codegraph 会为代码中的每个符号、函数和连接构建一个本地知识图谱,让 AI 代理可以即时查找信息,而无需通过 grep 搜索数千个文件。据报告,这能降低约 35% 的成本,减少约 70% 的工具调用。
@BrooksWhaleX:重大消息:有人刚刚开源了一个面向代码库的知识图谱引擎,好得可怕。它……
GitNexus 是一个开源的知识图谱引擎,它能索引代码库、映射依赖关系和执行流程,并通过 MCP 与 AI 编程助手集成,提供完整的架构清晰度,以防止破坏性变更。
vitali87/code-graph-rag
Code-Graph-RAG 是一个开源工具,使用 Tree-sitter 解析多语言代码库,在 Memgraph 中构建知识图谱,并让你用自然语言查询、编辑和优化代码。它支持在统一图模式下的混合语言 monorepo。
Graphify-Labs/graphify
Graphify将整个项目(代码、文档、PDF、图片、视频)映射成一个知识图谱,可通过AI编码助手进行查询,并利用tree-sitter AST进行本地代码解析。