制作用于微调的合成数据集
摘要
作者提出了一种使用形式求解器为LLM生成多样化合成推理训练数据的流程,并询问现有工作以及关于避免重复模板的建议。
我一直在考虑构建一个流程来生成LLM的推理训练数据,但我希望避免合成数据常见的失败模式,即仅用不同数字生成相同的模板。大致思路:
生成抽象推理任务(逻辑、规划、图问题、数学、算法等)使用教师模型和/或程序生成器
将任务转化为自然语言
尽可能使用形式求解器/验证器求解
仅保留具有已验证解的样本
从多个教师模型收集尝试以创建更好的训练信号
使用难度指标创建课程
主要问题:是否有现有论文或项目做类似的事情?防止合成推理数据变得重复的好方法是什么?是从形式语法/模拟器/环境生成任务更好,还是主要依赖LLM生成的问题?有没有人在较小的开源模型上尝试过这种方法?我特别感兴趣的是最大化推理模式多样性的方法,而不仅仅是扩展样本数量。目标不是直接训练模型,而是为蒸馏创建高质量数据集。理想情况下,该框架应与模型无关:生成器和求解器可以替换为不同的教师/学生模型,甚至在自我改进循环中使用。声明:我使用了LLM重写此内容,仅为了使表达更清晰并修正拼写错误。
相似文章
用于小型语言模型算术微调的结构化合成推理数据
本文研究了在消费级硬件限制下,结构化合成推理数据是否能提升小型语言模型的算术推理能力。使用基于GSM8K的合成语料库,通过LoRA对Qwen3-0.6B和Qwen3-1.7B进行微调,精确匹配准确率提升了12-13个百分点,并在相关基准测试中表现出较强的迁移能力。
学习通过洞察进行非形式化定理证明的推理
本论文提出了DeepInsightTheorem,一个分层数据集和渐进式多阶段有监督微调训练策略,通过教导大语言模型识别和应用核心技术来改进其非形式化定理证明能力。
@tom_doerr: 大语言模型指令与推理数据集精选列表 https://github.com/mlabonne/llm-datasets…
由 mlabonne 整理的大语言模型指令与推理数据集列表,包含数据集特征、许可证及用例详情。
构建程序性推理评估数据集:平衡自然性、基础性和多跳覆盖
本文探讨了基于TMK的问题生成策略如何影响AI学习系统中程序性和多跳推理的数据集质量,比较了严格TMK生成、先转录后生成和TMK感知生成三种策略,并引入了一个基础性验证框架。
面向API调用智能体的无环境合成数据生成
本文提出了一种面向训练API调用LLM智能体的无环境合成数据生成方法,利用LLM作为即时数字世界模型生成轨迹,并在具有挑战性的基准测试上展现出显著的性能提升。