QVAC Genesis III: 一个大规模、高质量的开放合成 STEM 语料库,用于高效语言模型预训练

arXiv cs.AI 论文

摘要

QVAC Genesis III 是一个开源的合成 STEM 语料库,旨在提升语言模型预训练的效率,与先前的数据集相比,在基准测试中表现出显著改进。

arXiv:2609.19513v1 公告类型:新 摘要:高质量的预训练数据是针对边缘 AI 和设备端部署的教育及 STEM 特定语言模型的关键瓶颈,这些场景中 token 预算受到严格限制。虽然主要组织在私有语料库上训练越来越大的模型,但开放生态系统缺乏专注于 STEM 的合成数据集,这些数据集能够高效地为小模型提供高 per-token 学习价值。为了填补这一空白,我们引入了 QVAC Genesis III,这是一个 191.43B-token、专注于 STEM 的多领域合成语料库,涵盖多个难度级别的 19 个领域和不同的教育风格。QVAC Genesis III 通过双生成策略构建,该策略使用弱边缘规模的学生模型作为信号进行定向教师蒸馏:学生的错误被转换为纠正性解释,而其成功则扩展为针对所有答案选项的对比选项级推理。我们进一步引入了 LLM 作为解析器的评估协议,从自由形式输出中提取最终答案,并跟踪准确性和答案有效性。为了验证我们 QVAC Genesis III 数据的有效性,我们使用 1.7B 参数模型进行了受控的从头消融实验,结果显示,使用 QVAC Genesis III 训练的模型在 ARC、GPQA Diamond 和 MMLU STEM 基准测试中始终优于使用开源合成语料库 Cosmopedia-v2 训练的模型和公开发布的 Cosmo-1B 模型,在 ARC-E 上高达 +28.57%,在 ARC-C 上高达 +21.35%,同时有效答案率高达 99.45%。
查看原文
查看缓存全文

缓存时间: 2026/09/18 09:18

# 一个用于高效语言模型预训练的大规模、高质量开放合成STEM语料库
来源:https://arxiv.org/html/2609.19513
N\. RanjanAkshay NambiarKamal K\. GuptaAmril Nazir
隶属机构:Tether Data, S\.A\. de C\.V\. d\.b\.a\. Tether AI Research

###### 摘要
高质量的预训练数据是面向边缘AI和设备端部署的教育与STEM领域专用语言模型的关键瓶颈,在这些场景中,token预算受到严格限制。虽然主要机构在私有语料库上训练越来越大的模型,但开放生态系统缺乏专注于STEM的合成数据集,这些数据集无法为小型模型高效地提供高token学习价值。为解决这一缺口,我们推出了**QVAC Genesis III**,这是一个包含191.43亿token、专注于STEM的多领域合成语料库,覆盖19个领域、多种难度级别和不同的教育风格。QVAC Genesis III通过**双生成策略**构建,该策略利用一个弱边缘规模学生模型作为信号进行针对性的教师蒸馏:学生的*失败*被转化为纠正性解释,而其*成功*则扩展为对所有答案选项的对比性选项级推理。我们进一步引入了**LLM-as-a-parser**评估协议,从自由形式输出中提取最终答案,并跟踪准确性和答案有效性。为验证QVAC Genesis III数据的有效性,我们使用17亿参数的模型进行了受控的从头消融研究,结果表明,使用QVAC Genesis III训练的模型在ARC、GPQA Diamond和MMLU STEM基准测试中,持续优于使用开源合成语料库Cosmopedia-v2训练的模型以及公开发布的Cosmo-1B模型,在ARC-E上最高提升+28.57%,在ARC-C上最高提升+21.35%,同时达到高达99.45%的有效答案率。

## 1 引言
教育与STEM(科学、技术、工程、数学)领域专用的语言模型至关重要,因为它们推动大型语言模型超越基础文本生成,实现精确推理和复杂问题解决。融入专注STEM的数据直接提升了事实准确性和逻辑鲁棒性。然而,尽管有此需求,开放生态系统中高质量的STEM预训练数据仍然稀缺。主要来源——大规模网络爬取——在STEM领域代表性不足,且缺乏严格的正确性验证和多领域分类,使其对于需要事实精确性和严谨推理的教育和专业场景而言并不可靠。此外,主要机构维护着精心策划的STEM语料库,但未公开发布,这进一步拉大了拥有资源训练超大规模模型的实验室与旨在构建高效实用部署模型的学术或小型团队之间的差距。

对于必须在训练期间保持适度计算基础设施计算可行性的定制模型而言,在严格受限的token预算下进行预训练至关重要,因为每个训练token都必须提供最大的学习价值(Hoffmann等人,2022)。同时,在互联网连接有限的边缘设备(智能手机、笔记本电脑和嵌入式系统)以及必须以离线模式运行的隐私敏感本地服务器上运行这些模型的需求也在增长。这催生了对1-2B参数范围内、能够在严格内存、延迟和能量限制下运行的小型高效模型的巨大需求。

合成数据已成为弥合这一差距的关键策略。微软的Phi系列证明了大规模合成数据集可以训练出具有竞争力的的小模型(Li等人,2023),而HuggingFace的Cosmopedia则首次开放地复现了这一方法(Ben Allal等人,2024)。然而,现有的开放合成语料库仍然不够专注于STEM,且缺乏边缘规模推理密集型预训练所需的*token效率*。当参数数量和token预算都受限时,训练数据的*结构*和*质量*远比单纯数量重要。另一个效率问题是,当前流程系统性地丢弃了模型失败中蕴含的学习信号。错误答案通常被过滤掉以避免污染语料库,但这同时也移除了那些揭示概念差距和错误观念的样本,而这些是高价值的监督信号,可以提高鲁棒性和推理能力,尤其是对于无法将容量浪费在冗余内容上的小型模型。

我们通过**QVAC Genesis III**来解决这些局限,这是一个包含191.43亿token、专注于STEM、覆盖19个领域和三种难度级别(高中、大学和专业)的多领域教育合成语料库。QVAC Genesis III通过**双生成策略**(图1)构建,该策略从一个强大的推理模型向边缘规模的学生模型进行**针对性的教师蒸馏**:学生的*失败*和*成功*都被转化为结构化、高价值的训练内容:

1.  **失败分析**流程。当学生生成错误答案时,我们触发一个由教师驱动的流程,诊断可能的误解并生成针对性的纠正性解释,将每次失败转化为集中的教学时刻。
2.  **选项级**推理流程。当学生答对时,教师将该实例扩展为对*所有*答案选项的详细选项级推理:解释为什么正确选项成立以及每个干扰项为何错误,从而提供比单路径解决方案更丰富的监督信号。

这些流程共同确保了没有学生信号被浪费:失败变成了纠正性课程,成功则变成了全面的推理演示。内容以四种互补风格(教育教科书、网络文章、问答和对话)呈现,以最大化多样性。

我们进一步引入了**LLM-as-a-parser**评估协议(图2),该协议从完整的模型生成输出中提取最终答案,并报告准确性和**有效答案率(VAR)**,将格式可靠性与领域知识解耦,从而实现更公平的比较。在使用17亿参数模型进行的受控从头消融研究中,QVAC Genesis III在ARC、GPQA和MMLU STEM基准测试上相对于Cosmopedia-v2基线模型和公开发布的Cosmo-1B模型(HuggingFace SmolModels团队,2024)均产生了巨大提升,同时选项级划分达到了接近完美的99.45% VAR(第5节)。这些结果表明,即使在固定的计算预算下,token高效、结构丰富的合成数据也能显著提升边缘规模模型的能力。

## 2 相关工作

#### 用于LLM预训练的合成数据。缩放定律(Hoffmann等人,2022)确立了数据质量和数量共同决定LLM性能,这推动了生成高质量合成语料库的努力。微软的Phi系列是首批证明数十亿合成token可以训练出与在有机数据上训练的更大系统相媲美的小模型的研究之一(Li等人,2023),这一发现对于模型尺寸受限的边缘规模部署尤为重要。Phi-4通过引入多智能体提示、自我修订工作流和指令反转进一步扩展了这一方向,表明合成数据的质量(而不仅仅是数量)驱动了推理能力的提升,并且学生模型甚至可以超越其教师(Abdin等人,2024)。HuggingFace的Cosmopedia首次大规模*开放*复现了Phi风格的数据配方(Ben Allal等人,2024),而同期关于网络语料库整理的工作,包括FineWeb(Penedo等人,2024)和Ultra-FineWeb(Wang等人,2025),则开发了质量分类器,用于从大规模爬取数据中选择高价值种子段落。尽管取得了这些进展,现有的开放合成数据集在STEM覆盖范围上仍然有限,并且没有针对边缘规模模型所要求的token效率进行优化,在这些模型严格限定的预训练预算中,每个token都必须携带最大的学习信号。

#### 知识蒸馏与从模型错误中学习。知识蒸馏(Hinton等人,2015)将能力从大型教师转移到较小的学生,通常通过在教师生成的输出上进行训练。在LLM环境中,Orca(Mukherjee等人,2023)表明,从GPT-4生成的详细解释轨迹中进行渐进式学习可以显著提高小模型的推理能力。最近,Burns等人(2024)研究了弱到强的泛化,发现即使从不完美的监督中也能引出强大的模型。然而,这些方法都统一*过滤掉*不正确的教师或学生输出;失败中蕴含的学习信号——误解、推理错误、格式歧义——被系统性地丢弃。我们的失败分析流程反转了这一惯例:我们不删除不正确的学生回应,而是将其用作提示,让教师生成针对性的纠正性解释,将每个错误转化为集中的教学时刻。与我们方法互补的是,关于主动合成数据生成的近期工作(Kessler等人,2025)表明,基于学生性能迭代整理数据优于静态生成,尽管该工作侧重于微调而非大规模预训练。

#### 对比性与选项级推理。标准的合成问答数据集只保留正确的解题轨迹,让模型隐式推断为何其他答案错误。对比性解释明确阐述干扰项为何错误,已被证明可以改善小规模教育场景中的泛化能力(Talmor等人,2020)。我们的选项级推理流程将这一原则扩展到预训练:对于每个正确回答的选择题,教师生成详尽的选项级论证,涵盖正确选项和每个干扰项,从而提供比单路径解决方案更丰富的监督信号。

#### 基于LLM的多项选择题基准评估。LLM的多项选择题评估传统上依赖于对答案token的对数似然评分。更新的框架,如OpenCompass(OpenCompass Contributors,2023),支持**LLM-as-a-judge**协议,其中单独的模型对开放式输出进行评分或评级,这遵循了Zheng等人(2023)引入的范式。然而,评判评估的是回答的*质量*,这与可靠地从可能包含推理、犹豫或自我修正的自由文本中*提取*最终确定的答案是不同的。我们通过**LLM-as-a-parser**框架扩展了OpenCompass:解析器不是评估回答质量,而是被指示仅恢复模型的最终选项选择,或者在无法识别明确答案时选择放弃。这产生了两个解耦的指标:标准准确性和**有效答案率(VAR)**,它独立于领域知识量化了答案的可提取性,这一区别对于基于似然和基于评判的评估都是不可见的。

## 3 方法论
我们通过双方法合成数据流水线构建QVAC Genesis III,该流水线将每个生成的多项选择题转换为符合教学结构的文本(图1)。该流水线包括(i)种子获取和质量过滤,(ii)MCQ生成,(iii)模型回答与答案提取,以及(iv)根据提取的答案是否与金标准标签匹配,分支进入**失败分析**或**选项级推理**。所有用于MCQ生成、回答、答案提取和FA/OL渲染的提示模板均在附录F中提供。请参阅图1说明:双方法合成数据生成流水线概述。种子段落经过质量过滤,转换为MCQ,由学生模型回答,并通过LLM-as-a-parser提取进行解析。正确答案被路由到选项级推理;错误或无法提取的答案被路由到失败分析。详情见第3节。

### 3.1 种子获取与质量过滤

#### 种子获取。我们从FineFineWeb获取种子段落,这是一个按粗略领域组织的大规模网络语料库(M-A-P等人,2024)。我们将每个FineFineWeb领域映射到下游使用的、符合课程标准的生成子领域(完整映射见附录A);例如,FineFineWeb的biology种子用于生成college_biology和high_school_biology的项目。我们持续采样候选种子,直到在过滤后获得约50万个高质量种子。

#### 质量过滤。原始网络文本包含样板文件、低信息内容和其他噪声,可能降低下游合成数据的质量。因此,我们应用Ultra-FineWeb分类器(Wang等人,2025),一个用于质量判别的FastText风格二元分类器,对每个采样段落进行处理,并保留所有被分类为正的实例。由此产生的正例集构成了用于MCQ生成的种子池。

### 3.2 MCQ生成与格式验证

#### MCQ生成。给定目标领域和难度级别的过滤种子,我们使用QwQ-32B(Qwen团队,2025)作为生成器模型来生成自包含的MCQ。我们选择QwQ-32B作为生成器和教师模型,因为其32B参数可以在提供有竞争力的推理性能的同时实现高吞吐量部署,使其成为无需过高基础设施即可进行大规模合成数据生成的实用选择。每个生成的项目包括一个问题、四个互斥的答案选项(A-D)和一个指示正确选择的金标准标签。我们通过结构化提示模板强制执行输出约束,该模板要求恰好四个选项、固定的CSV-like模式,以及正确标签在A/B/C/D中的均匀分布,以防止位置偏差。

#### 后处理与拒绝。尽管有提示约束,仍有一小部分生成内容违反了格式要求(例如,字段数量错误或标签无效)。我们应用一个轻量级的Python后处理脚本验证每个生成的行,仅保留格式正确的实例。大约15%的原始生成被此验证步骤拒绝。

### 3.3 回答模型与答案提取

#### 学生生成。为了大规模获取成功/失败信号,我们需要一个代表QVAC Genesis III所定位的边缘规模模型的学生模型。我们的分析表明,1-2B参数模型在训练计算可行性和下游性能之间提供了最佳平衡...

相似文章

@neural_avb: https://x.com/neural_avb/status/2072294078805684613

X AI KOLs Timeline

本论文介绍了Autodata,这是一种利用智能“数据科学家”AI的方法,通过迭代生成、验证和优化来自动创建高质量合成数据集,该方法特别针对强化学习(GRPO)进行了优化,以提升语言模型的推理能力。

SGOCR:一个空间定位的、以OCR为核心的流水线与V1数据集 [P]

Reddit r/MachineLearning

大家好!我一直在独立研究和开发小巧但强大的视觉语言模型(VLM),并注意到视觉数据集中的一个空白——没有一个数据集在教我的模型简单地将文本定位到图像中,而是试图让模型推理文本或场景本身。这促使我投入两周的副项目,创建了SGOCR,一个开源数据集流水线,用于生成空间定位的、以OCR为核心的VQA元组,包含大量丰富的元数据以支持多样化的VLM训练策