通过最小充分表示学习实现的大语言模型领域特定数据合成
摘要
DOMINO 是一个新颖的框架,它从参考示例中学习最小充分的领域表示,为LLMs合成领域特定数据,从而在不要求显式领域描述的情况下提升代码基准性能。
查看缓存全文
缓存时间: 2026/06/03 15:38
论文页面 - 基于最小充分表示学习的领域特定数据合成
来源:https://huggingface.co/papers/2605.30039
摘要
DOMINO 通过归纳式方法实现领域特定数据合成,该模型从参考示例中学习领域表示,无需显式领域描述即可提升代码基准测试性能。
大型语言模型在通用能力方面取得了显著进展,并可通过领域特定数据的微调在特定领域实现强劲性能。然而,为目标领域获取高质量数据仍然是一个重大挑战。现有数据合成方法遵循演绎范式,严重依赖自然语言表达的显式领域描述以及精细的提示工程,限制了它们在现实场景中的适用性——这些场景中的领域难以描述或正式表达。在这项工作中,我们通过归纳范式解决了一个尚未充分探索的问题:领域特定数据合成,其中目标领域仅通过一组参考示例来定义,尤其在领域特征难以用自然语言表达时。我们提出了一种新框架 DOMINO,它从参考样本中学习最小充分的领域表示,并利用该表示指导生成领域对齐的合成数据。DOMINO 将提示调整与对比解耦目标相结合,以分离领域级模式与样本特定噪声,在保留核心领域特征的同时缓解过拟合。理论上,我们证明了 DOMINO 扩展了合成数据分布的支持范围,确保了更大的多样性。在领域定义隐含的具有挑战性的编码基准上,使用 DOMINO 合成的数据微调后,Pass@1 准确率相比强大的指令调优基干模型提升了最多 4.63%,展示了其有效性和鲁棒性。这项工作为领域特定数据合成建立了新范式,无需手动提示设计或自然语言领域规范即可实现实用且可扩展的领域适应。
查看 arXiv 页面 (https://arxiv.org/abs/2605.30039)查看 PDF (https://arxiv.org/pdf/2605.30039)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.30039)
在您的智能体中获取这篇论文:
hf papers read 2605.30039
没有最新的 CLI?curl \-LsSf https://hf.co/cli/install.sh \| bash
引用此论文的模型0
没有模型链接此论文
请在一个模型的 README.md 中引用 arxiv.org/abs/2605.30039 以将其链接至此页面。
引用此论文的数据集0
没有数据集链接此论文
请在一个数据集的 README.md 中引用 arxiv.org/abs/2605.30039 以将其链接至此页面。
引用此论文的 Spaces0
没有 Space 链接此论文
请在一个 Space 的 README.md 中引用 arxiv.org/abs/2605.30039 以将其链接至此页面。
包含此论文的收藏0
没有包含此论文的收藏
请将此论文添加到一个收藏 (https://huggingface.co/new-collection)中以将其链接至此页面。
相似文章
DSLs 使得 LLMs 的可靠使用成为可能
本文探讨了领域特定语言(DSL)如何在使用 LLMs 进行代码生成时提高可靠性和设计洞察力,强调迭代设计和受限语法。
一域多语:无需配对数据构建跨语言遥感MLLM的领域与语言LoRA组合
本文介绍了Modl技术,该技术通过组合领域与语言LoRA并实现互正交性,创建跨语言遥感多模态大语言模型(MLLM),在无需配对多语言数据的情况下实现卓越性能。
SOMA:通过小语言模型实现高效的 LLM 多轮对话服务
本文介绍了 SOMA,这是一种高效的 LLM 多轮对话服务框架,它利用经过软提示和 LoRA 微调适配的小语言模型来降低延迟和成本。
模仿游戏:当LLMs通过代码中心推理数据合成学会像程序一样推理
MIMIC是一个框架,它使用可执行代码为LLMs合成推理轨迹,通过代码工具奖励增强其确定性推理,并在推理基准测试中取得改进的性能。
制作用于微调的合成数据集
作者提出了一种使用形式求解器为LLM生成多样化合成推理训练数据的流程,并询问现有工作以及关于避免重复模板的建议。