在低资源语言中思考:监督微调构建了什么,强化学习修复了什么,准确率无法看到什么
摘要
本文研究了在低资源语言中进行推理的监督微调和强化学习,揭示了准确率基准存在噪声,而监督微调构建了特定语言的推理能力,强化学习修复了格式和泄漏问题。
查看缓存全文
缓存时间: 2026/08/19 10:01
# 引言:一个数字,六个维度
来源:https://arxiv.org/html/2608.17744
![[未命名图片]](https://arxiv.org/html/2608.17744v1/figures/kiefer_logo_v2.png)![[未命名图片]](https://arxiv.org/html/2608.17744v1/figures/sophea_owl_v2.png)
**在低资源语言中思考:SFT构建了什么,RL修正了什么,准确率看不到什么**
Ayoub Kirouane¹,Christos Petrocheilos¹
¹Sophea AI, KIEFER SA, 雅典,希腊
{a.kirouane, c.petrocheilos}@kiefer.gr
[email protected]
模型与基准:https://huggingface.co/KIEFERSA
2026年8月
**摘要**
选取三个前沿混合专家模型(Alibaba、OpenAI、NVIDIA;每个模型各有约3.6–4.0B活跃参数),将其微调以在低资源语言中进行推理。在准确率基准测试上,几乎没有任何变化,且在此尺度下基准测试本身即是噪音:仅改变随机种子就能使分数变动7.7分,超过我们测量的每一个数据集和配方效应。这一“无变化”本身即是我们第一个真实结果。真正的变化存在于准确率无法捕捉之处。基础模型从不用希腊语思考:在1,000个推理链中无一使用希腊语,即使问题本身是希腊语,模型也能正确作答,但其推理过程用户无法阅读、审计或纠正。经过监督微调(SFT)后,每个发布的检查点在约98%的项目上以问题所属语言进行推理,其中一个模型系列在3倍更少的token内完成,四个模型的语法评判在两种语言中均有所改善,且通用能力在各自基础模型的几个百分点以内:知识未被遗忘,流畅度得以提升。我们提出了六个行为维度,使此类变化可被量化(模型以何种语言推理、消耗了何种资源、能否区分易题与难题、以及它忘记了什么),每个维度都设置了门控以拒绝任何与输出长度相关的指标,并报告了我们自身的测量工具如何“说谎”:六次失败,每一次都被对照组捕获,每一次都曾让我们确信某些错误之事。SFT无法修复的是其自身的缺陷:四分之一的回答跳过了指定格式,回答内容泄露到推理通道中,而明确的“用英语思考”指令的遵守率不足一半。使用可验证奖励的强化学习,在训练前预先注册,彻底修正了前两个问题(回答格式回退率24%→2.5%,回答通道泄露率3.5%→0.0%,两者均优于平坦随机奖励对照组),并将第三个问题改进了+9.1个百分点(真实但未达到其预注册目标),而希腊语推理习惯在仅针对准确率的梯度更新中未受影响(保真度98.2%)。我们发布了五个检查点。测量工具、对照组和预注册方法可迁移至任何低资源语言;希腊语是让我们得以测量它们的案例。一个推理微调的评判方式与任何微调相同:一个准确率数字,微调前后各一个。对于低资源语言,这个数字回答了一个无人提出的问题。它未说明模型*用*何种语言进行推理、达到该结果消耗了多少token、能否区分简单与困难问题,或为此放弃了什么。本研究围绕低资源部署实际面临的约束——推理服务账单——而设计。我们保持每个token的*活跃*参数数量固定(3.6–4.0B),并改变实验室:来自Alibaba、OpenAI和NVIDIA的三个稀疏混合专家模型系列,每个系列代表前沿实验室在相同推理预算下的不同架构选择(§2 [https://arxiv.org/html/2608.17744#S2])。稀疏MoE架构之所以备受关注,恰恰因为它成本低廉:一个拥有20-36B参数的模型,以4B稠密模型的成本提供服务,这使得本地推理模型对无法承担前沿规模推理的社区而言变得经济可行。在所有三个系列中运行相同的配方、语料库和测量工具,使我们能够将微调本身的效果与某一特定架构的偶然效应区分开来。希腊语已有专门的开放模型生态系统(如Meltemi和Krikri指令模型[35, 26]、其翻译评估套件,以及我们自己的Sophea-Titan-1通用模型),我们在此基础上构建而非从零开始。但该生态系中所有模型都未测量长篇*推理*行为:这些模型用希腊语作答,但没有任何发布的检查点用希腊语进行显式思考推理,目前也没有任何希腊语基准能区分一个用希腊语思考的模型与一个在英文中规划并在最终翻译的模型。我们测量了所有这些,对比结果构成了本文的核心。在准确率上,几乎没有变化(§7 [https://arxiv.org/html/2608.17744#S7] 中15个实验组中最佳得分为76.5,基础模型为77.2,两者均基于思考模式下1,000个条目的三轴希腊语测试),数周内我们曾将其视为语料库问题并构建了五个新语料库以修复。无一修复,最终我们进行了本应首先做的实验:重新训练一个配置,仅改变随机种子。分数变动了7.7分。我们此前解读的每一个差异(更优的数据选择、更好的语料库、更改的训练调度)都小于此数。本文即是在该发现之后留存的内容,以及替代它的内容,按照推理必须展开的顺序叙述。§2 [https://arxiv.org/html/2608.17744#S2] 固定模型、语料库和评估通道;§3 [https://arxiv.org/html/2608.17744#S3] 在启用任何维度前定义这六个维度。§4 [https://arxiv.org/html/2608.17744#S4] 确立噪声基线。§5 [https://arxiv.org/html/2608.17744#S5] 展示确实发生变化的属性:模型推理的语言、消耗的token,以及能否区分简单与困难问题——这些变化不体现于准确率,且对种子不敏感。§6 [https://arxiv.org/html/2608.17744#S6] 追问微调忘记了什么。一个训练配方的比较足以作为独立的附带实验保留:它解释了我们的回答格式失败模式,也是唯一一个在15个独立训练实验组中复制存在,而非仅从单次运行中读取的准确率效应;它在§7 [https://arxiv.org/html/2608.17744#S7] 中按自身逻辑报告。§8 [https://arxiv.org/html/2608.17744#S8] 报告了六次测量工具失败:五个对照组分别扼杀或纠正了我们曾相信的发现,§9 [https://arxiv.org/html/2608.17744#S9] 阐明了它们教导我们的验收规则。§10 [https://arxiv.org/html/2608.17744#S10] 随后修复了配方导致的缺陷(语言锁定),§11 [https://arxiv.org/html/2608.17744#S11] 回答了剩余两个预先注册的问题。后续内容按领域(§12 [https://arxiv.org/html/2608.17744#S12])和按模型系列(§13 [https://arxiv.org/html/2608.17744#S13])解读相同证据,§14 [https://arxiv.org/html/2608.17744#S14]–16 [https://arxiv.org/html/2608.17744#S16] 则基于这些证据陈述我们能与不能推荐的内容。
**核心主张**。我们发现,对于低资源语言的推理微调,基于翻译基准的准确率几乎没有信息量:它受训练噪音主导、被回答格式效应扭曲,并被标准检查未发现的污染所夸大。行为维度是稳定的、显著的,并测量了微调的实际目的。
## 设置
**模型**。来自三个不同实验室的三个稀疏混合专家模型系列[30, 12](共四个检查点,因Nemotron系列包含两代),之所以选择它们,是因为它们占据了*相同的推理服务预算*,却用其进行了不同的架构押注:
**表1**:从发布张量中计算的总参数和路由专家参数;每token活跃参数为非路由参数 + k/E × 路由参数。Gpt-OSS发布MXFP4打包的专家,因此其数据为供应商报告。NemotronH (Nano) 和 Nemotron-3.5-Lightning是Mamba/MoE混合体(结合了Mamba、MoE和注意力层;状态空间模型来源于Gu and Dao 2023 [14], Dao and Gu 2024 [8] 以及供应商的Nemotron-H报告[21]);另两个是MoE Transformer。最右列命名了每个基础模型微调后的Sophea推理发布版本;所有四个SFT发布版本语言匹配,第五个发布版本Sophea-Qwen3.6-v1.1是Qwen行的RLVR精炼版(§15.1 [https://arxiv.org/html/2608.17744#S15.SS1])。全文中,*基础*指供应商检查点,*微调*指其对应的Sophea推理模型。Lightning是Nemotron系列的下一代发布;Nano和Lightning共享31.6B / 6-of-128的路由配置,因此统一报告为Nemotron系列(Nano是该系列同代成员)。总参数量差异为1.7倍,而活跃参数量差异为11%。三者的推理成本大致相同,但消耗预算的方式不同:Qwen路由256个专家中的8个(每token占其参数的3.1%),Gpt-OSS路由32个中的4个(12.5%),NemotronH路由128个中的6个,同时用状态空间层替换了大部分注意力层。用*总参数*比较会得出Qwen是Gpt-OSS 1.7倍大小的模型;用*活跃参数*比较则认为它们规模相同。我们同时报告两者,并视活跃参数为有意义的维度,因为它是部署时付费的对象。这也划定了我们结果可推广的范围:MoE模型的结论不能直接用于稠密模型(局限性部分)。且MoE改变了LoRA的附加对象。
**适配**。LoRA [16],r=32,α=64,1个epoch,有效批量32,学习率2×10⁻⁴。所有训练、合并和评估均在单个NVIDIA DGX B200节点上运行:8×B200 GPU(每个180GB HBM3e,总计1.44TB),这使得本文所有配置无需FSDP分片之外的模型并行,这是一个刻意的约束,因为低资源语言的配方应在单个节点上可复现。*专家步长3*意味着适配器放置在每三个MoE层上,而非所有层;共享专家(位于每个token的路径上)始终包含在内。采用步长是因为专家数量而非模型大小决定了适配器数量:当模型将专家存储为堆叠参数时,PEFT为每个堆栈附加一个适配器(Qwen为28个,Gpt-OSS为16个);但当专家以独立的nn.Linear模块实例化时,它为每个专家附加一个:在我们分析的模型上有4,188个独立的适配器张量,其开销在于内核启动和梯度all-reduce的步时,而非浮点运算。此外,在我们的库版本下,融合专家LoRA无法通过PeftModel.from_pretrained加载,因此每个Qwen检查点在评估前都被合并为稠密权重。
**语料库**。118,092行希腊语文本,分为几乎相等的两部分。*推理部分*(59,107行)在单独字段中包含明确推理链。其98.5%为合成数据:问题和标准答案来自公开英语数据集,但推理链是生成的(见下文)。仅894行包含非我们生成的推理链(领域分布见表2 [https://arxiv.org/html/2608.17744#S2.T2])。*直接回答部分*(58,985行)无推理链。它是Sophea-Titan-1(先前发布的希腊语模型)的指令语料库,未作更改直接复用:Aya [33](33.8%)、希腊语指令集(25.8%)、合成多轮对话(10.1%)、希腊语问答(7.7%)以及十二个较小来源,外加约2,600行领域思维链(法律、医疗、金融、能源)和50行身份信息行。其91%为希腊语,9%为英语(5,211行),英语部分特意保留作为防止灾难性遗忘的回放数据。复用一个已产出可用希腊语模型的语料库,是我们最初未怀疑此部分的原因。其预期作用是保持模型的非推理模式活跃,确实如此:§7 [https://arxiv.org/html/2608.17744#S7] 显示省略它会导致推理开关失效。同样根据证据,它也是导致模型大部分准确率和回答格式遵守率下降的原因。这一张力是本文唯一一个经过复制的配方发现。
**表2**:推理部分数学内容占比较高,在我们评估最严格的轴上(常识和逻辑)内容较少(常识占6.6%,逻辑占8.7%)。
**推理链来源**。问题和标准答案取自公开英语数据集并翻译;*推理链是生成的,而非翻译的*。要求翻译人员呈现思维链会得到整洁的摘要(这正是接下来描述的缺陷),因此我们提示LLM用希腊语重新解答每个问题,仅当其最终答案与标准答案一致时才保留推理链。生成器是来自同一家族的两个前沿商业模型:一个用于数学部分(问题来自OpenR1-Math-220k),更大的一个用于逻辑、常识和重新生成的ECQA部分;其余推理行未修改地沿用自其来源(Llama-Nemotron后训练科学、医疗、Dolci)。每行都包含一个记录其来源的source字段。未通过标准检查的行被丢弃而非修复(答案门控规则来自STaR [40]):错误的推理链会教授错误的推理。典型收益率根据来源在60-95%之间。
**推理链体裁及其测量**。区分有用与无用推理链的属性并非正确性,而是*结构*:文本是否展示了思考过程(尝试了候选方案、发现了缺陷、进行了纠正),而不仅仅是证明一个已得出的结论[19, 13]。我们通过公式 S = 0.40b + 0.25v + 0.25p + 0.10ℓ 进行评分,其中b是回溯标记的存在,v是验证,p是流畅散文而非编号列表的比例,ℓ是长度项。回溯之所以占主导,是因为这是最终写成的文本从未具备的属性。S是*语料库*诊断指标,用于决定训练数据,而非§3 [https://arxiv.org/html/2608.17744#S3] 中的模型指标。这一区分并非理论性的。一个公开的希腊语常识解释集(ECQA问题翻译成希腊语,保留原始人工撰写的理由)得分为S=0.27,其中0%的推理链得分高于0.5;而使用上述提示为*相同问题*重新生成推理链得分为S=0.68,97%得分高于0.5。我们最初的语料库中72%是编号列表,这促使我们进行探索。
**命名**。实验组根据实际区分它们的特征(训练配方和推理行数量)命名,而非内部版本标签(表3 [https://arxiv.org/html/2608.17744#S2.T3]):
**表3**:Two-Phase在混合数据上延续了Reasoning的*相同适配器*;One-Phase从不分离两部分。三种配方以不同方式失效(§7 [https://arxiv.org/html/2608.17744#S7])。Subset是相同推理行的一个抽样,最初由推理链结构分数选取;§4.3 [https://arxiv.org/html/2608.17744#S4.SS3] 显示该选择方式并不优于随机抽取相同数量的行,因此我们按其本质(一个子集)而非未获证据支持的方法命名。
**基准测试**。5,156个希腊语条目:数学250个,人文...相似文章
在低资源语言中的思考:SFT构建了什么,RL修复了什么,准确率看不见什么
本论文探讨了微调MoE模型使其用希腊语推理的过程,发现准确率指标存在噪声,而监督微调(SFT)和强化学习(RL)提升了特定语言的推理能力并修复了行为缺陷,并提出了评估工具。
学习该学什么:面向小语言模型SFT-then-RL推理的分阶段专属数据集
本文提出了一种难度感知的SFT-then-RL框架,用于在推理任务上训练小语言模型(参数量≤3B),核心观点是数据难度应与SFT(学习新技能)和RL(巩固已有技能)各自的不同角色相匹配。作者为困难SFT样本引入了Bridge机制,并针对RL失败案例提出了Critique Fine-Tuning方法,在五个推理基准测试上均取得了一致性提升。
Probing the Origins of Reasoning Performance: Representational Quality for Mathematical Problem-Solving in RL vs. SFT Fine-Tuned Models
This paper investigates internal representational differences between RL and SFT fine-tuned models on mathematical reasoning, finding that RL models exhibit more linearly separable hidden states and hierarchical layer importance. Token allocation variability under repeated sampling suggests training pipeline dependence rather than RL vs SFT alone.
RASFT:面向推理的滚动自适应监督微调
RASFT是一种新颖的大型语言模型监督微调框架,它根据模型自身的推理能力调整专家监督,在数学和代码推理基准测试中相比标准SFT和强化学习方法取得了更好的性能。
论SFT的泛化:强化学习视角与奖励修正
本文从强化学习的视角分析了标准监督微调(SFT)的局限性,并提出了一种简单的梯度重新缩放方法——动态微调(DFT),该方法提高了LLM的泛化能力,并与离线RL性能相匹配。