通过最小充分表示学习实现的大语言模型领域特定数据合成

Hugging Face Daily Papers 论文

摘要

DOMINO 是一个新颖的框架,它从参考示例中学习最小充分的领域表示,为LLMs合成领域特定数据,从而在不要求显式领域描述的情况下提升代码基准性能。

大语言模型在通用能力方面取得了显著进展,并通过在领域特定数据上进行微调,在特定领域中也能够实现强劲性能。然而,为目标领域获取高质量数据仍然是一个重大挑战。现有的数据合成方法遵循演绎范式,严重依赖以自然语言表达的显式领域描述和精细的提示工程,这限制了它们在现实场景中的适用性——在这些场景中,领域难以描述或正式表达。在这项工作中,我们通过归纳范式解决了未被充分探索的领域特定数据合成问题,其中目标领域仅通过一组参考示例来定义,特别是在领域特征难以用自然语言表达的情况下。我们提出了一个新颖的框架 DOMINO,它从参考样本中学习最小充分的领域表示,并利用该表示来指导生成与领域对齐的合成数据。DOMINO 将提示调优与对比解耦目标相结合,以将领域级模式与样本特定噪声分离,从而在保留核心领域特征的同时减轻过拟合。理论上,我们证明 DOMINO 扩展了合成数据分布的支持范围,确保了更大的多样性。在经验上,在领域定义隐式的具有挑战性的代码基准上,使用 DOMINO 合成的数据进行微调,其 Pass@1 准确率相比强大的指令调优基座模型最高提升 4.63%,展示了其有效性和鲁棒性。这项工作为领域特定数据合成建立了一种新范式,无需手动设计提示或自然语言领域规范,即可实现实用且可扩展的领域适应。
查看原文
查看缓存全文

缓存时间: 2026/06/03 15:38

论文页面 - 基于最小充分表示学习的领域特定数据合成

来源:https://huggingface.co/papers/2605.30039

摘要

DOMINO 通过归纳式方法实现领域特定数据合成,该模型从参考示例中学习领域表示,无需显式领域描述即可提升代码基准测试性能。

大型语言模型在通用能力方面取得了显著进展,并可通过领域特定数据的微调在特定领域实现强劲性能。然而,为目标领域获取高质量数据仍然是一个重大挑战。现有数据合成方法遵循演绎范式,严重依赖自然语言表达的显式领域描述以及精细的提示工程,限制了它们在现实场景中的适用性——这些场景中的领域难以描述或正式表达。在这项工作中,我们通过归纳范式解决了一个尚未充分探索的问题:领域特定数据合成,其中目标领域仅通过一组参考示例来定义,尤其在领域特征难以用自然语言表达时。我们提出了一种新框架 DOMINO,它从参考样本中学习最小充分的领域表示,并利用该表示指导生成领域对齐的合成数据。DOMINO 将提示调整与对比解耦目标相结合,以分离领域级模式与样本特定噪声,在保留核心领域特征的同时缓解过拟合。理论上,我们证明了 DOMINO 扩展了合成数据分布的支持范围,确保了更大的多样性。在领域定义隐含的具有挑战性的编码基准上,使用 DOMINO 合成的数据微调后,Pass@1 准确率相比强大的指令调优基干模型提升了最多 4.63%,展示了其有效性和鲁棒性。这项工作为领域特定数据合成建立了新范式,无需手动提示设计或自然语言领域规范即可实现实用且可扩展的领域适应。

查看 arXiv 页面 (https://arxiv.org/abs/2605.30039)查看 PDF (https://arxiv.org/pdf/2605.30039)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.30039)

在您的智能体中获取这篇论文:

hf papers read 2605.30039

没有最新的 CLI?curl \-LsSf https://hf.co/cli/install.sh \| bash

引用此论文的模型0

没有模型链接此论文

请在一个模型的 README.md 中引用 arxiv.org/abs/2605.30039 以将其链接至此页面。

引用此论文的数据集0

没有数据集链接此论文

请在一个数据集的 README.md 中引用 arxiv.org/abs/2605.30039 以将其链接至此页面。

引用此论文的 Spaces0

没有 Space 链接此论文

请在一个 Space 的 README.md 中引用 arxiv.org/abs/2605.30039 以将其链接至此页面。

包含此论文的收藏0

没有包含此论文的收藏

请将此论文添加到一个收藏 (https://huggingface.co/new-collection)中以将其链接至此页面。

相似文章

制作用于微调的合成数据集

Reddit r/LocalLLaMA

作者提出了一种使用形式求解器为LLM生成多样化合成推理训练数据的流程,并询问现有工作以及关于避免重复模板的建议。