按需生成合成训练数据时,什么才是关键?
摘要
Abliteration 推出了一种按需定制的合成训练数据工作流,可为分类器生成负样本、罕见样本和对抗性样本,包含模式、真实世界事实、标签、来源追溯,并支持导出到 Hugging Face 等平台。
声明:我参与 Abliteration 的工作,我们刚刚推出了一种按需定制的训练数据工作流。我们反复遇到一个实际问题:团队确实需要分类器的负样本、罕见样本和对抗性样本,但这些样本恰恰是通用模型常常拒绝生成的内容。这使得安全分类器、滥用检测、越狱评估和安全研究数据集的构建变得比应有的更加困难。要让生成的训练数据真正有用,我认为不能仅仅提供一个输入框,还需要:
- 在生成开始前定义目标模式
- 在需要时能够混入当前或真实世界的事实
- 包含在导出后仍然保留的标签和理由码
- 足够的来源追溯信息,以便后续审查数据集
- 导出到人们已经使用的工具的路径
我们推出的这个功能允许你描述想要的样本,可以选择使用网络搜索,然后导出到 Hugging Face、Kaggle、S3 或 OpenAI。初始用例包括用于识别猥亵和骚扰的内容审核分类器、安全研究数据集以及模型评估。
产品:[https://abliteration.ai/](https://abliteration.ai/)
合成数据页面:[https://abliteration.ai/use-cases/synthetic-data](https://abliteration.ai/use-cases/synthetic-data)
发布/视频:[https://x.com/abliteration\_ai/status/2054675554138194178](https://x.com/abliteration_ai/status/2054675554138194178)
好奇这里的人如何看待可审查性。如果生成的数据集要用于分类器,你会希望为每一行记录哪些信息?
相似文章
生成更好训练数据的智能体(25分钟阅读)
Autodata 引入了一种智能体数据科学家,它能够迭代生成并优化合成训练数据,并通过元优化进一步提升数据质量,在计算机科学和法律推理任务上取得了更好的效果。
@yacinelearning: 很棒的资源,来自Hugging Face,附有幻灯片,介绍了他们如何生成1万亿合成数据,非常酷…
Hugging Face 分享了幻灯片,详细介绍了他们如何生成1万亿个token的合成数据来训练基础模型。
实验室训练10T参数模型使用的数据组合是什么?
关于实验室训练10T参数模型可能使用的数据来源的讨论,包括合成推理链和人类生成的痕迹,以及对触及数据墙的担忧。
当人工智能耗尽人类生成的数据时会发生什么?
随着AI模型消耗有限的人类生成数据,未来的训练可能会依赖其他AI产生的合成数据,这引发了关于长期影响的疑问。
@neural_avb: https://x.com/neural_avb/status/2072294078805684613
本论文介绍了Autodata,这是一种利用智能“数据科学家”AI的方法,通过迭代生成、验证和优化来自动创建高质量合成数据集,该方法特别针对强化学习(GRPO)进行了优化,以提升语言模型的推理能力。