CodeGraph:基于维基数据的开放分类源代码知识图谱

Hugging Face Daily Papers 论文

摘要

本文介绍了CodeGraph,一个用于源代码的大规模开放分类知识图谱,使用专用LLM构建并基于维基数据对齐,覆盖数百万文件和实体。

公共软件仓库,如GitHub和Software Heritage Archive,存储了数十亿文件,但提取其隐含的工程知识——即它们实现的算法、遵循的范式、实例化的模式以及服务的应用领域——仍然具有挑战性,因为当前工具受限于语法和令牌级分析。我们提出了一种流水线,用于使用代码专用LLM构建源代码的开放分类语义标注。提取的实体通过三阶段链接过程与Wikidata对齐:一个确定性SPARQL阶段处理明确实体,一个Deep Research Agent解决剩余的长尾问题,以及一个层次汇总阶段导入每个已解析Wikidata标识符的父级闭包。由此产生的标注被物化为源代码特定的开放分类知识图谱。我们进一步引入了一种校准的质量保证协议,通过结合少量人工金标准集和LLM作为裁判的过滤器来量化标注精度。我们将流水线应用于Stack-Edu语料库的1.67亿文件,创建了首个已知的大规模开放分类源代码知识图谱。我们的图谱名为CodeGraph,包含约1.58亿节点,其中包括约1.45亿文件、约6.3万个提取的概念实体(如算法、范式、设计模式和应用领域),以及约1.98万个与Wikidata对齐的实体。此外,CodeGraph具有约10亿个类型化边,将文件连接到其对应的概念,将这些概念链接到其Wikidata标识符,并将它们与父类别关联,涵盖14种编程语言。
查看原文
查看缓存全文

缓存时间: 2026/09/28 16:05

论文页面 - CodeGraph:基于Wikidata锚定的源代码开放分类知识图谱

来源:https://huggingface.co/papers/2609.29474

摘要

公共软件仓库(如GitHub和Software Heritage Archive)存储着数十亿文件,然而提取其中隐含的工程知识——即它们实现的算法、遵循的范式、实例化的模式以及服务的应用领域——仍然具有挑战性,因为现有工具仅限于语法和标记层面的分析。本文提出一种利用代码专用大语言模型构建源代码开放分类语义标注的流程。提取的实体通过三阶段链接过程锚定到Wikidata:确定性SPARQL阶段处理无歧义实体,深度研究智能体解决剩余的长尾实体,层级归并阶段导入每个已解析Wikidata标识符的父级闭包。最终生成的标注被构建为面向源代码的开放分类知识图谱。我们进一步引入一种校准化质量保障协议,通过结合少量人工黄金集和LLM评判过滤器来量化标注精度。我们将此流程应用于包含1.67亿文件的Stack-Edu语料库,创建了首个已知的大规模源代码开放分类知识图谱。该图谱名为CodeGraph,包含约1.58亿节点,其中包括约1.45亿文件、约6.3万个提取的概念实体(如算法、范式、设计模式和应用领域),以及约1.98万个锚定的Wikidata实体。此外,CodeGraph具有约10亿条类型边,这些边将文件连接到相应概念,将这些概念链接到其Wikidata标识符,并关联到父级分类,覆盖14种编程语言。

查看arXiv页面 (https://arxiv.org/abs/2609.29474) 查看PDF (https://arxiv.org/pdf/2609.29474) GitHub0 (https://github.com/halykoss/CodeGraph) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.29474)

引用此论文的模型0

没有模型链接此论文

在模型README.md中引用arxiv.org/abs/2609.29474可从此页面链接。

引用此论文的数据集1

halykoss/CodeGraph 查看器• 3天前更新 • 1.18B • 4.88k (https://huggingface.co/datasets/halykoss/CodeGraph)

引用此论文的Spaces0

没有Space链接此论文

在Space README.md中引用arxiv.org/abs/2609.29474可从此页面链接。

包含此论文的收藏夹0

没有收藏夹包含此论文

将此论文添加到收藏夹 (https://huggingface.co/new-collection) 可从此页面链接。

相似文章

colbymchenry/codegraph

GitHub Trending (daily)

CodeGraph 是一个开源工具,为代码库创建预索引的知识图谱,使 Claude Code 的探索代理能够即时查询符号关系和调用图,将工具调用次数减少高达 96%,探索时间减少 77%。

vitali87/code-graph-rag

GitHub Trending (daily)

Code-Graph-RAG 是一个开源工具,使用 Tree-sitter 解析多语言代码库,在 Memgraph 中构建知识图谱,并让你用自然语言查询、编辑和优化代码。它支持在统一图模式下的混合语言 monorepo。

Graphify-Labs/graphify

GitHub Trending (daily)

Graphify将整个项目(代码、文档、PDF、图片、视频)映射成一个知识图谱,可通过AI编码助手进行查询,并利用tree-sitter AST进行本地代码解析。