制作用于微调的合成数据集

Reddit r/LocalLLaMA 新闻

摘要

作者提出了一种使用形式求解器为LLM生成多样化合成推理训练数据的流程,并询问现有工作以及关于避免重复模板的建议。

我一直在考虑构建一个流程来生成LLM的推理训练数据,但我希望避免合成数据常见的失败模式,即仅用不同数字生成相同的模板。大致思路: 生成抽象推理任务(逻辑、规划、图问题、数学、算法等)使用教师模型和/或程序生成器 将任务转化为自然语言 尽可能使用形式求解器/验证器求解 仅保留具有已验证解的样本 从多个教师模型收集尝试以创建更好的训练信号 使用难度指标创建课程 主要问题:是否有现有论文或项目做类似的事情?防止合成推理数据变得重复的好方法是什么?是从形式语法/模拟器/环境生成任务更好,还是主要依赖LLM生成的问题?有没有人在较小的开源模型上尝试过这种方法?我特别感兴趣的是最大化推理模式多样性的方法,而不仅仅是扩展样本数量。目标不是直接训练模型,而是为蒸馏创建高质量数据集。理想情况下,该框架应与模型无关:生成器和求解器可以替换为不同的教师/学生模型,甚至在自我改进循环中使用。声明:我使用了LLM重写此内容,仅为了使表达更清晰并修正拼写错误。
查看原文

相似文章

用于小型语言模型算术微调的结构化合成推理数据

arXiv cs.AI

本文研究了在消费级硬件限制下,结构化合成推理数据是否能提升小型语言模型的算术推理能力。使用基于GSM8K的合成语料库,通过LoRA对Qwen3-0.6B和Qwen3-1.7B进行微调,精确匹配准确率提升了12-13个百分点,并在相关基准测试中表现出较强的迁移能力。

面向API调用智能体的无环境合成数据生成

Hugging Face Daily Papers

本文提出了一种面向训练API调用LLM智能体的无环境合成数据生成方法,利用LLM作为即时数字世界模型生成轨迹,并在具有挑战性的基准测试上展现出显著的性能提升。