实验室训练10T参数模型使用的数据组合是什么?
摘要
关于实验室训练10T参数模型可能使用的数据来源的讨论,包括合成推理链和人类生成的痕迹,以及对触及数据墙的担忧。
所以我假设:根据不同的报道,到目前为止,实验室公开的最大模型参数为2-3T。他们目前正在内部训练或已经训练了10T参数模型。我的另一个假设是:如果模型参数增加3倍,那么数据也需要按比例增加3倍或一定幅度。但自GPT-4时代以来,我们就一直听到关于基于互联网数据的数据墙被触及的消息。那么情况如何?他们从哪里获得这么多数据?大部分是模型在推理过程中生成的推理链吗?还是来自像Mercor这样的实际人类生成的推理痕迹?有人知道确切的数据组合吗?或者到底发生了什么?看起来突然需要大量数据。
相似文章
生成更好训练数据的智能体(25分钟阅读)
Autodata 引入了一种智能体数据科学家,它能够迭代生成并优化合成训练数据,并通过元优化进一步提升数据质量,在计算机科学和法律推理任务上取得了更好的效果。
智能体数据
NVIDIA 讨论了开放数据和合成数据对于构建稳健 AI 智能体的重要性,并重点介绍了他们用于训练、推理和工具使用的 Nemotron 开放数据集。
按需生成合成训练数据时,什么才是关键?
Abliteration 推出了一种按需定制的合成训练数据工作流,可为分类器生成负样本、罕见样本和对抗性样本,包含模式、真实世界事实、标签、来源追溯,并支持导出到 Hugging Face 等平台。
@neural_avb: https://x.com/neural_avb/status/2072294078805684613
本论文介绍了Autodata,这是一种利用智能“数据科学家”AI的方法,通过迭代生成、验证和优化来自动创建高质量合成数据集,该方法特别针对强化学习(GRPO)进行了优化,以提升语言模型的推理能力。
[大数据集发布] - SupraLabs/reasoning-corpus-4K-5M-v1 - 训练你的小型 SLM 学会思考!
SupraLabs 发布了 reasoning-corpus-4K-5M-v1,一个包含 500 万样本的推理数据集,用于训练小型语言模型 (SLM),包含思维链追踪和 ChatML 格式,托管在 Hugging Face 上。