用于小型语言模型算术微调的结构化合成推理数据

arXiv cs.AI 论文

摘要

本文研究了在消费级硬件限制下,结构化合成推理数据是否能提升小型语言模型的算术推理能力。使用基于GSM8K的合成语料库,通过LoRA对Qwen3-0.6B和Qwen3-1.7B进行微调,精确匹配准确率提升了12-13个百分点,并在相关基准测试中表现出较强的迁移能力。

arXiv:2607.18266v1 公告类型:新论文 摘要:小型语言模型适合本地部署,但在多步算术推理方面往往表现不佳。我们研究了在消费级硬件限制下,结构化合成推理数据能否改善这一表现。从GSM8K出发,我们使用GPT-5-mini生成了一个包含21,250个示例的小学算术应用题变体语料库,其中结合了自然语言求解轨迹、轻量苏格拉底式提示、结构变化以及无关干扰上下文。随后,我们在消费级硬件(Apple M4,16 GB RAM)上使用LoRA微调了Qwen3-0.6B和Qwen3-1.7B。在GSM8K上,Qwen3-0.6B的精确匹配准确率从36.5%提升至49.1%,Qwen3-1.7B从53.5%提升至66.5%。对于Qwen3-1.7B,向相关算术基准的迁移能力更强,在MultiArith上达到98.9%,在SVAMP上达到73.0%,而基础模型分别为54.4%和45.3%。定性分析表明,微调后的模型产生的推理轨迹更短,算术错误和干扰项使用错误更少,并且更稳定地从自一致性采样中获益。这些结果表明,低成本的合成数据设计能够显著改善小型语言模型的算术适应性。由于该干预措施结合了苏格拉底式提示与其他数据设计选择,我们将性能提升解释为结构化合成推理数据的证据,而非单独对苏格拉底式引导的因果检验。
查看原文
查看缓存全文

缓存时间: 2026/07/22 08:21

# 面向小型语言模型算术微调的结构化合成推理数据

来源:https://arxiv.org/html/2607.18266

Effirul Ramlan  
高威大学计算机科学学院  
effirul\.ramlan@universityofgalway\.ie

###### 摘要

小型语言模型在本地部署方面颇具吸引力,但在多步算术推理上往往表现不佳。本文研究在消费级硬件约束下,结构化合成推理数据能否改善这一行为。以GSM8K为起点,我们使用GPT-5-mini生成了一个包含21,250个样例的小学算术应用题变体语料库,融合了自然语言解答轨迹、轻量苏格拉底式提示、结构变化以及无关干扰上下文。随后,我们在消费级硬件(Apple M4,16 GB RAM)上使用LoRA对Qwen3-0.6B和Qwen3-1.7B进行了微调。在GSM8K上的精确匹配准确率,Qwen3-0.6B从36.5%提升至49.1%,Qwen3-1.7B从53.5%提升至66.5%。对于Qwen3-1.7B,向相关算术基准的迁移能力更强,在MultiArith上达到98.9%,在SVAMP上达到73.0%,而基础模型分别为54.4%和45.3%。定性分析表明,微调后的模型产生的推理轨迹更短,算术和干扰项使用错误更少,并且更稳定地从自一致性采样中获益。这些结果表明,低成本的合成数据设计能够实质性改善小型语言模型的算术适应能力。由于干预措施同时包含了苏格拉底式提示和其他数据设计选择,我们将这些改进解释为结构化合成推理数据的证据,而非对苏格拉底式指导单独进行的因果检验。

#### 关键词:微调,小型语言模型,合成数据,苏格拉底式指导,LoRA,GSM8K,算术推理

## 1 引言

大型语言模型(LLM)能够解决广泛的推理任务,包括多步算术 [2, 12],并且可以通过思维链推理等提示策略提升其性能 [28]。较小规模的语言模型在消费级硬件上本地部署更为实用,但在需要多步计算、操作选择以及抵抗无关上下文的任务上,它们仍然不太可靠。因此,实际存在的差距是显而易见的。最适合低成本部署的模型,恰恰也是最有可能在使语言模型有用的推理行为上失败的模型。

越来越多的研究工作通过参数高效微调 [8]、检索增强生成 [13] 以及基于人类或自动反馈的强化学习 [17, 9] 来弥补这一差距。LoRA [10] 和 QLoRA [5] 等 PEFT 方法显著降低了模型适配的计算成本,使得在适度的硬件预算下进行微调成为可能。与此同时,遵循 Self-Instruct 范式 [27] 的教师生成合成数据集表明,无需大规模人工标注也能产生有用的训练信号。

训练数据的结构也很重要。以推理为中心的监督训练表明,中间推理轨迹可以改善多步问题求解 [28, 26],而小模型对微调数据的表面格式尤其敏感 [32]。苏格拉底式提问和费曼技巧等教育方法强调主动的、由问题驱动的推理,而非被动地接触示例 [4, 21, 19]。在 LLM 推理的推理阶段,也探索了苏格拉底式提示 [20]。然而,关于轻量苏格拉底式提示直接嵌入到小型语言模型的合成微调数据中时表现如何,目前了解甚少。

本文研究在消费级硬件约束下,针对小型语言模型的算术适应能力,采用结构化合成推理数据。以 GSM8K [3] 为起点,我们构建了一个过滤后的合成数据集,融合了自然语言解答轨迹、轻量苏格拉底式提示、结构变化以及刻意引入的无关上下文。然后,我们使用 LoRA 微调 Qwen3-0.6B 和 Qwen3-1.7B,并在 GSM8K、MultiArith 和 SVAMP 上评估其性能。这些数据设计选择是同时引入的,因此结果应被解释为结构化合成推理数据的证据,而非对苏格拉底式指导单独进行的因果检验。

我们的贡献如下:

1.  我们提出了一种低成本的流水线,用于从 GSM8K 构建经过过滤的合成算术推理数据,融合了自然语言解答轨迹、轻量苏格拉底式提示、结构变化、干扰上下文以及多阶段过滤。
2.  我们展示了在此数据集上进行 LoRA 微调,能够提升 Qwen3-0.6B 和 Qwen3-1.7B 在 GSM8K 上的精确匹配准确率,并且对相关算术基准 MultiArith 和 SVAMP 具有更强的迁移能力。
3.  我们分析了微调过程中的实用设计经验,包括解答格式的影响、LoRA 层的覆盖范围,以及算术错误、干扰项使用和推理简洁性方面的定性变化。

## 2 相关工作

参数高效微调使得在更适度的计算预算下进行模型适配成为可能。LoRA [10] 冻结预训练权重,并在选定的 Transformer 层中学习低秩适配矩阵,从而减少了微调所需的可训练参数数量。QLoRA [5] 通过将基础模型量化到 4 位精度来扩展此方法,允许在有限内存下适配更大的模型。AdaLoRA [31] 进一步表明,适配器容量无需在模型中均匀分布,前馈层通常比注意力层获得更高的秩分配。这些方法为在消费级硬件约束下适配小型和量化模型提供了技术基础。

合成数据为低成本模型适配提供了另一条途径。DistilBERT [23] 表明,紧凑的学生模型可以通过蒸馏从更大的教师模型中继承有用行为。Self-Instruct [27] 和 Stanford Alpaca [25] 随后表明,教师生成的指令数据可以在规模上支持指令遵循。在数学推理方面,MetaMath [30] 和 WizardMath [16] 证明,基于 GSM8K 的扩充可以显著提升算术和数学应用题基准的性能。我们的工作遵循了这种合成数据方向,但专注于在本地硬件约束下为小型模型进行低成本的數據生成和微调。

先前的工作还表明,推理信号的形式很重要。思维链提示 [28] 通过向模型展示中间推理轨迹来改善多步推理,而自一致性采样 [26] 则通过聚合多个推理路径来改进答案选择。LIMA [32] 表明,小型、高质量的数据集可以产生不成比例的效果,但也强调了较小模型对微调数据表面格式的敏感性。这对于算术微调尤其重要,因为模型可能学习到解答格式的可见结构,而非底层的操作选择行为。

苏格拉底式推理提供了构建这种训练信号的一种可能方式。苏格拉底式提问已被探索作为一种推理阶段策略,通过将问题分解为引导性子问题来改善 LLM 推理 [20]。关于基于语言游戏的苏格拉底式学习的相关理论工作 [24] 将结构化对话视为通往递归改进的途径,尽管主要是在更大规模的设置中。这些研究激发了使用问题驱动的推理提示,但它们并未确定此类提示在直接嵌入小型语言模型的合成微调数据时表现如何。因此,我们将苏格拉底式指导视为结构化合成推理数据集的一个组成部分,而非一个孤立的因果机制。

## 3 方法

### 3.1 数据集构建

我们使用 GSM8K [3] 作为构建合成训练数据和主要保留评估的源数据集。GSM8K 包含 7,473 个带有详细解答的训练问题和 1,319 个问题的测试集,是小学算术推理的标准基准。

每个 GSM8K 训练问题通过 OpenAI 批量 API 提交给 GPT-5-mini (gpt-5-mini-2025-08-07)。生成提示要求模型为每个源问题生成三个变体。每个变体需要改变源问题的措辞、结构、数值或难度,包含至少一句无关上下文,在解答叙述中包含一两个轻量苏格拉底式引导问题,并以 GSM8K [3] 中使用的 `####` 分隔符标记的数值答案结束。合成解答以自然语言推理轨迹的形式编写,包含内联计算,而非僵化的步骤列表。选择这种方式是因为早期的数据集设计导致微调模型复制表面模板,而非解决底层算术任务,详见第 6 节。在所有数据生成运行中,总 API 成本为 12.8M 令牌花费 $20.88。

生成的输出通过一个四阶段过滤流水线处理。第一阶段要求有效的 `Question:` 和 `Solution:` 字段以及格式正确的 `####` 最终答案。第二阶段去除过短或过长的解答。第三阶段应用 5-gram Jaccard 去重,阈值为 0.85,以减少近乎重复的项。第四阶段去除出现在 `####` 分隔符之前的反问句,因为早期实验表明模型在推理时可能重现这种模式。过滤后的数据集使用随机种子 42 按 90/10 划分为训练集和验证集,得到 19,125 个训练样本和 2,125 个验证样本。

### 3.2 LoRA 微调

微调使用 MLX LM [1] 进行,这是 Apple 为 Apple Silicon 设计的机器学习框架。统一内存架构使得可用的 16 GB RAM 可以用于模型训练,而无需固定的 CPU-GPU 内存分割。我们对 Qwen3 系列 [29] 的两个模型进行微调:Qwen3-0.6B 使用 bfloat16 精度作为主要的小模型目标,以便在消费级硬件上快速迭代;Qwen3-1.7B 使用 4 位量化,以测试相同流水线在相同内存限制下能否应用于更大的模型。

LoRA 适配器应用于全部 28 个 Transformer 层。在每个适配层中,我们针对自注意力模块中的查询 (WQ)、键 (WK)、值 (WV) 和输出 (WO) 投影,以及前馈模块中的门控、上投影和下投影。对于一个预训练权重矩阵 W0 ∈ R^(d×k),LoRA 将适配后的层表示为:

h = (W0 + ΔW)x = W0x + BAx,  (1)

其中 A ∈ R^(r×k) 和 B ∈ R^(d×r) 是可训练的低秩因子,且 r << min(d,k)。基础矩阵 W0 保持冻结。矩阵 A 从 N(0, σ²) 初始化,B 初始化为零,因此训练开始时 ΔW = 0。

所有运行均使用 AdamW,其中 β1=0.9,β2=0.98,ε=1e-6,权重衰减 0.01 [15]。我们使用带线性预热 [14] 的余弦学习率衰减,批次大小为 4,梯度累积步数为 32,有效批次大小为 128,最大序列长度为 2,048 个令牌。所有六次微调运行的完整超参数细节见附录 B。

### 3.3 实现细节

模型输出是自由格式文本,因此每个输出必须被解析以提取单个数值预测用于精确匹配比较。我们使用正则表达式搜索 `####` 分隔符最后一次出现后跟整数或小数的情况。使用最后一次匹配是因为基线模型有时会在重新陈述最终答案前产生一个中间估计。数值预测在比较前进行归一化,因此诸如 8.0 和 8 这样的值被视为等价。没有有效最终答案模式的输出被记录为空预测并计为错误。

训练上限设为:Qwen3-0.6B 运行 6,000 次迭代,最大的 Qwen3-1.7B 运行 10,000 次迭代。每 200 步在保留的验证集上评估验证损失。实际上,验证损失在大约 5,000 步时趋于稳定,表明迭代预算并非瓶颈。对于每次运行,使用验证损失最低的检查点进行报告的评估,而非最终检查点。

评估结果在每个问题后写入 CSV 文件。每条记录存储问题索引、采样输出、提取的预测以及每个预测是否与真实答案匹配。如果评估运行中断,流水线从上个已完成的问题恢复,避免重复评分。

### 3.4 评估协议

主要评估使用 GSM8K 测试集,采用 4-shot 提示,遵循原始基准设置 [3]。我们报告精确匹配准确率:

Accuracy = #{As = Ag} / N,  (2)

其中 As 是模型预测,Ag 是真实的数值答案,N 是测试案例数量。除非另有说明,主要的 GSM8K 结果每个问题使用一个采样输出。为了比较,我们评估基础 Qwen3-0.6B 和 Qwen3-1.7B 模型,以及多个开源基线,在相同的提示和答案提取条件下进行。

相似文章

提示微调:数据越少,推理能力越强

arXiv cs.CL

本文提出了一种名为“提示微调”(Hint Tuning)的数据高效方法,该方法根据问题难度校准推理深度,从而减少推理模型中的标记使用量。在仅需1K个自标注样本的情况下,该方法在 Qwen3-Thinking 和 DeepSeek-R1-Distill 等模型上实现了显著的标记减少(24%-66%)。