GraphGen:利用知识驱动的合成数据生成增强大语言模型的监督微调
摘要
GraphGen是一个知识图谱引导的框架,用于生成合成问答数据,以改进大语言模型的监督微调,通过多跳采样和风格控制生成来针对知识缺口。实验表明,它优于传统的合成数据方法。
查看缓存全文
缓存时间: 2026/08/03 13:29
论文页面 - GraphGen:利用知识驱动的合成数据生成增强大语言模型的监督微调
来源:https://huggingface.co/papers/2505.20416 发布于 2025年5月26日
摘要
GraphGen 是一个知识图谱引导的框架,通过构建细粒度知识图谱、针对高价值知识缺口,并采用多跳采样和风格受控生成,来解决大语言模型合成数据生成中的挑战。
微调(https://huggingface.co/papers?q=Fine-tuning)大型语言模型(https://huggingface.co/papers?q=large%20language%20models)(LLM)通常需要大量高质量的有监督数据,而这些数据的获取既昂贵又耗费人力。尽管合成数据生成(https://huggingface.co/papers?q=synthetic%20data%20generation)已成为一种有前景的解决方案,但现有方法常常存在事实不准确、长尾覆盖不足、知识结构过于简单以及输出同质化等问题。为了解决这些挑战,我们引入了 GraphGen,一个知识图谱(https://huggingface.co/papers?q=knowledge%20graph)引导的框架,专门针对三类关键问答(QA)场景:原子问答、聚合问答和多跳问答(https://huggingface.co/papers?q=multi-hop%20QA)。它首先从源文本构建细粒度的知识图谱(https://huggingface.co/papers?q=knowledge%20graph)。然后,利用期望校准误差(https://huggingface.co/papers?q=expected%20calibration%20error)指标识别大语言模型中的知识缺口(https://huggingface.co/papers?q=knowledge%20gaps),优先生成针对高价值、长尾知识的问答对。此外,GraphGen 还引入了多跳邻域采样(https://huggingface.co/papers?q=multi-hop%20neighborhood%20sampling)来捕获复杂的关联信息,并通过风格受控生成来多样化最终生成的问答数据。在闭卷设置(https://huggingface.co/papers?q=closed-book%20settings)下的知识密集型任务上的实验结果表明,GraphGen 优于传统的合成数据方法,为监督微调(https://huggingface.co/papers?q=fine-tuning)中的数据稀缺挑战提供了更可靠、更全面的解决方案。代码和数据已在 https://github.com/open-sciencelab/GraphGen 公开提供。
查看 arXiv 页面(https://arxiv.org/abs/2505.20416)查看 PDF(https://arxiv.org/pdf/2505.20416)项目页面(https://huggingface.co/spaces/chenzihong/GraphGen)GitHub 1.17k(https://github.com/open-sciencelab/GraphGen)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2505.20416)
在您的代理中获取此论文:
hf papers read 2505.20416
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2505.20416 以从此页面链接它。
引用此论文的数据集 1
chenzihong/GraphGen-Data 预览• 更新于 2025年6月16日 • 27 • 2(https://huggingface.co/datasets/chenzihong/GraphGen-Data)
引用此论文的 Space 1
包含此论文的收藏集 1
相似文章
通过基于知识图谱的数据生成实现精确的文本到Cypher转换
本文提出了一种合成数据生成方法,用于微调小型LLM,将自然语言转换为属性图的Cypher查询,在实现本地部署和数据主权的同时,达到了与大型专有模型相竞争的性能。
增强元认知AI:基于图论的大语言模型富集的知识图谱填充
MetaKGEnrich是一个全自动流水线,使用图指标检测大语言模型应用中的知识缺口,检索网络证据,并在三个基准数据集上将答案质量提升80%-87%。
目标条件监督学习用于LLM微调
本文提出了目标条件监督学习(GCSL)作为LLM的离线微调框架,该方法将反馈作为显式目标,通过一种新颖的目标公式和自然语言目标表示,使用监督学习训练模型。在无毒生成、代码生成和LLM推荐三个任务上的评估显示,该方法优于标准的离线基线方法。
RSF-GLLM: 通过递归软流与解耦LLM生成弥合多跳知识图谱问答中的语义鸿沟
本文介绍了RSF-GLLM,一个将可微图推理与LLM生成解耦的框架,以解决多跳知识图谱问答中的语义鸿沟问题,在实现竞争性性能的同时,具有卓越的推理效率。
基于外部子图生成的大语言模型逐步推理增强
本文提出了SGR框架,通过查询相关的子图生成将外部知识图谱与大语言模型相结合,融合基于Cypher的推理与协同推理集成,从而增强大语言模型的逐步推理能力。在CWQ、WebQSP、GrailQA和KQA Pro上的实验表明,该框架相比标准提示方法和知识增强基线具有更高的推理准确性。