生成更多数据何时更有帮助?——在合成数据扩展中区分固定源合成与源扩展
摘要
本文在合成数据扩展中区分了固定源合成(FSS)与源扩展,提出了一种修正的缩放定律,能够从低预算拟合预测高预算下的性能。实验结果表明,FSS 是有界的,并且在大规模下,增加种子问题比增加回答预算表现更好。
arXiv:2607.01727v1 公告类型:新
摘要:合成数据可以通过两种途径进行扩展:源扩展(SE),即通过添加种子材料或生成器来扩大源;以及固定源合成(FSS),即保持源固定并扩展生成预算。现有的扩展研究通常随着数据增长而扩展源,将SE与FSS混为一谈,导致FSS未被充分探索。我们通过保持种子问题池和教师模型不变,仅改变拒绝采样(RS)下每个问题的回答预算,从而将FSS独立出来。我们将修正的缩放定律应用于FSS,从重复采样如何覆盖固定源推导出该定律。实验上,该推导形式在低预算下拟合,能够预测每个评估的教师-学生组合在最高保留预算下的性能。在匹配的总样本预算下,SE和FSS在小预算下表现相当;在大预算下,添加种子问题比将相同预算花在更多回答上表现更好。然而,在FSS内部,无论从现有种子合成额外问题还是改变合成协议,在匹配预算下都不优于简单的RS。因此,FSS是一个有界的扩展轴,也是比较合成协议的可控设置。我们将发布我们的代码和数据以促进进一步研究。
查看缓存全文
缓存时间: 2026/07/03 05:41
# 更多生成何时有用?在合成数据扩展中分离固定源合成与源扩展 来源:https://arxiv.org/abs/2607.01727 查看 PDF (https://arxiv.org/pdf/2607.01727) > 摘要:合成数据可通过两种路径扩展:源扩展(Source Expansion, SE),即通过添加种子材料或生成器来扩大源;以及固定源合成(Fixed-Source Synthesis, FSS),即保持源固定,仅扩展生成预算。现有的扩展研究通常在数据增长时同时扩展源,混淆了 SE 与 FSS,导致 FSS 未被充分探索。本文通过固定种子问题池和教师模型,仅在拒绝采样(Rejection Sampling, RS)下改变每个问题的响应预算,从而将 FSS 分离出来。我们将修正标度律适配到 FSS,通过重复采样如何覆盖固定源来推导该定律。实验表明,该推导形式在低预算下拟合后,能预测每个教师-学生对中保留的最高预算的性能。在总样本预算匹配的情况下,SE 和 FSS 在小预算时表现相当;在大预算时,添加种子问题优于将相同预算用于更多响应。然而,在 FSS 内部,无论是基于现有种子合成额外问题,还是改变合成协议,在匹配预算下均未优于简单的 RS。因此,FSS 是一个有界的扩展轴,也是比较合成协议的可控设定。我们将发布代码和数据以促进进一步研究。 ## 提交历史 来自:徐郭 [查看邮箱 (https://arxiv.org/show-email/ae0fc093/2607.01727)] **\[v1\]** 2026年7月2日 星期四 05:31:36 UTC (228 KB)
相似文章
生成位置的重要性:面向标签偏斜联邦学习的预算感知合成增强
提出FedEAS,一种用于联邦学习中合成数据增强的预算感知策略,为每个客户端分配一个熵自适应的每类生成预算,在将生成成本降低94.1%的同时,恢复大部分完全类别平衡的准确性增益。
高效数据合成的一个信息论准则
本文从信息论角度解释了合成数据何时会改善或降低LLM训练效果,区分了信息开放和信息封闭的生成循环,并通过数据处理不等式解释了模型崩溃的原因。
基于语法书的低资源机器翻译合成数据生成的析因研究
本文介绍了一个流程,该流程使用大型语言模型从语法书中提取语法规则、示例句子和词汇表,以生成合成平行语料库,用于微调机器翻译模型,在三种低资源语言上实现了高达+8.8的ChrF++增益。
想要更好的合成数据?引导它:用于低资源语言生成的激活引导
本文研究了激活引导作为替代少样本提示的方法,用于生成低资源语言的合成数据。作者提出了LanguageSteering和QualitySteering策略,表明在早期层进行引导可以提高数据多样性并改善下游模型性能。
设计合成讨论生成系统:在线引导案例研究
本文介绍了合成讨论生成(SDG),一种新颖的NLP框架,用于创建模拟讨论,从而在社会科学研究中实现低成本的预实验。作者证明,较小的量化模型(7B-8B参数)可以以比GPT等专有模型低44倍的成本生成有效的模拟,并将该框架应用于评估在线讨论中的LLM引导者。