按需生成合成训练数据时,什么才是关键?

Reddit r/ArtificialInteligence 产品

摘要

Abliteration 推出了一种按需定制的合成训练数据工作流,可为分类器生成负样本、罕见样本和对抗性样本,包含模式、真实世界事实、标签、来源追溯,并支持导出到 Hugging Face 等平台。

声明:我参与 Abliteration 的工作,我们刚刚推出了一种按需定制的训练数据工作流。我们反复遇到一个实际问题:团队确实需要分类器的负样本、罕见样本和对抗性样本,但这些样本恰恰是通用模型常常拒绝生成的内容。这使得安全分类器、滥用检测、越狱评估和安全研究数据集的构建变得比应有的更加困难。要让生成的训练数据真正有用,我认为不能仅仅提供一个输入框,还需要: - 在生成开始前定义目标模式 - 在需要时能够混入当前或真实世界的事实 - 包含在导出后仍然保留的标签和理由码 - 足够的来源追溯信息,以便后续审查数据集 - 导出到人们已经使用的工具的路径 我们推出的这个功能允许你描述想要的样本,可以选择使用网络搜索,然后导出到 Hugging Face、Kaggle、S3 或 OpenAI。初始用例包括用于识别猥亵和骚扰的内容审核分类器、安全研究数据集以及模型评估。 产品:[https://abliteration.ai/](https://abliteration.ai/) 合成数据页面:[https://abliteration.ai/use-cases/synthetic-data](https://abliteration.ai/use-cases/synthetic-data) 发布/视频:[https://x.com/abliteration\_ai/status/2054675554138194178](https://x.com/abliteration_ai/status/2054675554138194178) 好奇这里的人如何看待可审查性。如果生成的数据集要用于分类器,你会希望为每一行记录哪些信息?
查看原文

相似文章

生成更好训练数据的智能体(25分钟阅读)

TLDR AI

Autodata 引入了一种智能体数据科学家,它能够迭代生成并优化合成训练数据,并通过元优化进一步提升数据质量,在计算机科学和法律推理任务上取得了更好的效果。

@neural_avb: https://x.com/neural_avb/status/2072294078805684613

X AI KOLs Timeline

本论文介绍了Autodata,这是一种利用智能“数据科学家”AI的方法,通过迭代生成、验证和优化来自动创建高质量合成数据集,该方法特别针对强化学习(GRPO)进行了优化,以提升语言模型的推理能力。