GraphGen:利用知识驱动的合成数据生成增强大语言模型的监督微调

Papers with Code Trending 论文

摘要

GraphGen是一个知识图谱引导的框架,用于生成合成问答数据,以改进大语言模型的监督微调,通过多跳采样和风格控制生成来针对知识缺口。实验表明,它优于传统的合成数据方法。

针对大型语言模型(LLM)的微调通常需要大量高质量的监督数据,而获取这些数据既昂贵又费人力。虽然合成数据生成已成为一种有前景的解决方案,但现有方法常常存在事实不准确、长尾覆盖不足、知识结构简单以及输出同质化等问题。为了解决这些挑战,我们引入了GraphGen,这是一个知识图谱引导的框架,专为三种关键的问答(QA)场景设计:原子问答、聚合问答和多跳问答。它首先从源文本构建细粒度的知识图谱。然后,使用预期校准误差度量来识别LLM中的知识缺口,优先生成针对高价值长尾知识的问答对。此外,GraphGen结合了多跳邻域采样以捕获复杂的关联信息,并采用风格控制生成使生成的QA数据多样化。在闭卷设置下的知识密集型任务上的实验结果表明,GraphGen优于传统的合成数据方法,为监督微调中的数据稀缺挑战提供了更可靠、更全面的解决方案。代码和数据可在https://github.com/open-sciencelab/GraphGen公开获取。
查看原文
查看缓存全文

缓存时间: 2026/08/03 13:29

论文页面 - GraphGen:利用知识驱动的合成数据生成增强大语言模型的监督微调

来源:https://huggingface.co/papers/2505.20416 发布于 2025年5月26日

摘要

GraphGen 是一个知识图谱引导的框架,通过构建细粒度知识图谱、针对高价值知识缺口,并采用多跳采样和风格受控生成,来解决大语言模型合成数据生成中的挑战。

微调(https://huggingface.co/papers?q=Fine-tuning)大型语言模型(https://huggingface.co/papers?q=large%20language%20models)(LLM)通常需要大量高质量的有监督数据,而这些数据的获取既昂贵又耗费人力。尽管合成数据生成(https://huggingface.co/papers?q=synthetic%20data%20generation)已成为一种有前景的解决方案,但现有方法常常存在事实不准确、长尾覆盖不足、知识结构过于简单以及输出同质化等问题。为了解决这些挑战,我们引入了 GraphGen,一个知识图谱(https://huggingface.co/papers?q=knowledge%20graph)引导的框架,专门针对三类关键问答(QA)场景:原子问答、聚合问答和多跳问答(https://huggingface.co/papers?q=multi-hop%20QA)。它首先从源文本构建细粒度的知识图谱(https://huggingface.co/papers?q=knowledge%20graph)。然后,利用期望校准误差(https://huggingface.co/papers?q=expected%20calibration%20error)指标识别大语言模型中的知识缺口(https://huggingface.co/papers?q=knowledge%20gaps),优先生成针对高价值、长尾知识的问答对。此外,GraphGen 还引入了多跳邻域采样(https://huggingface.co/papers?q=multi-hop%20neighborhood%20sampling)来捕获复杂的关联信息,并通过风格受控生成来多样化最终生成的问答数据。在闭卷设置(https://huggingface.co/papers?q=closed-book%20settings)下的知识密集型任务上的实验结果表明,GraphGen 优于传统的合成数据方法,为监督微调(https://huggingface.co/papers?q=fine-tuning)中的数据稀缺挑战提供了更可靠、更全面的解决方案。代码和数据已在 https://github.com/open-sciencelab/GraphGen 公开提供。

查看 arXiv 页面(https://arxiv.org/abs/2505.20416)查看 PDF(https://arxiv.org/pdf/2505.20416)项目页面(https://huggingface.co/spaces/chenzihong/GraphGen)GitHub 1.17k(https://github.com/open-sciencelab/GraphGen)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2505.20416)

在您的代理中获取此论文:

hf papers read 2505.20416

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2505.20416 以从此页面链接它。

引用此论文的数据集 1

chenzihong/GraphGen-Data 预览• 更新于 2025年6月16日 • 27 • 2(https://huggingface.co/datasets/chenzihong/GraphGen-Data)

引用此论文的 Space 1

包含此论文的收藏集 1

相似文章

目标条件监督学习用于LLM微调

arXiv cs.LG

本文提出了目标条件监督学习(GCSL)作为LLM的离线微调框架,该方法将反馈作为显式目标,通过一种新颖的目标公式和自然语言目标表示,使用监督学习训练模型。在无毒生成、代码生成和LLM推荐三个任务上的评估显示,该方法优于标准的离线基线方法。

基于外部子图生成的大语言模型逐步推理增强

arXiv cs.CL

本文提出了SGR框架,通过查询相关的子图生成将外部知识图谱与大语言模型相结合,融合基于Cypher的推理与协同推理集成,从而增强大语言模型的逐步推理能力。在CWQ、WebQSP、GrailQA和KQA Pro上的实验表明,该框架相比标准提示方法和知识增强基线具有更高的推理准确性。