TUDUM:面向Qwen3.5-27B的土耳其语思维推理流水线
摘要
本文介绍了TÜDÜM,一个用于使Qwen3.5-27B能够用土耳其语进行显式推理的流水线,该流水线在土耳其语推理数据上使用SFT和基于GRPO的强化学习。结果显示,土耳其语推理一致性得到改善,但基准测试表现参差不齐,提供了一个诚实的评估,而非声称达到最先进水平。
arXiv:2607.01927v1 公告类型:新
摘要:本文介绍了TUDUM(T\"urk\c{c}e D\"u\c{s}\"unen \"Uretken Model),一个用于将Qwen系列27B思维模型适配到土耳其语推理的项目流水线。核心问题不仅是用土耳其语回答土耳其语提示,还要让显式推理过程本身使用土耳其语。思维模型可能会将土耳其语提示翻译成以英语为核心的内部或可见草稿板,大部分用英语解决问题,只将最终答案本地化。TUDUM则将生成的<think>...</think>块视为可训练行为。流水线从项目基础检查点unsloth/Qwen3.5-27B开始,使用LoRA适配器在15,991个土耳其语推理示例上进行监督微调(SFT),然后在经过代理过滤的土耳其语数学环境上应用GRPO系列强化学习。结果是混合的。SFT使模型更简洁,推理行为更一致地使用土耳其语,平均响应长度和思维耗尽现象大幅减少,但降低了基准测试准确率。RL恢复了一些数学性能,尤其是在最佳早期检查点上的AIME24,但并未一致提升所有基准测试,也未能超过基础模型在报告的Macro-6平均值上的表现。因此,该贡献最好被描述为一个技术上诚实的土耳其语思维推理流水线和评估,而非声称达到最先进的土耳其语推理水平。已发布的step-50模型可公开获取。
查看缓存全文
缓存时间: 2026/07/03 05:41
# TÜDÜM:Qwen3.5-27B的土耳其语思维推理流水线
来源:https://arxiv.org/html/2607.01927
###### 摘要
本文介绍TÜDÜM(*Türkçe Düşünen Üretken Model*,即“土耳其语思考生成模型”),这是一个用于将Qwen系列27B思维模型适配至土耳其语推理的项目流程。核心问题不仅在于用土耳其语回答土耳其语提示,更在于使显式的推理轨迹本身也使用土耳其语。一个思维模型可能会将土耳其语提示翻译成以英语为中心的内部或可见草稿本,主要用英语解决问题,仅对最终答案进行本地化。而TÜDÜM则将生成的...块视为一种可训练的行为。该流程从项目基准检查点`unsloth/Qwen3.5-27B`开始,使用LoRA适配器在15,991个土耳其语推理示例上进行监督微调(SFT),然后在经过代理过滤的土耳其语数学环境上应用GRPO系列强化学习。结果好坏参半。SFT使得模型在推理行为上更简短、更一致地使用土耳其语,平均响应长度和思维耗竭率大幅降低,但基准测试准确率有所下降。RL恢复了一部分数学性能,尤其是在最佳早期检查点上的AIME24成绩,但并未统一提升所有基准测试,在报告的宏观-6平均分上也未超过基础模型。因此,本文的贡献最好被界定为一个技术上诚实的土耳其语思维推理流程和评估,而非声称达到了最先进的土耳其语推理水平。已发布的第50步模型可公开获取。
![[无标题图片]](https://arxiv.org/html/2607.01927v1/assets/hf-logo.png)模型可用性:https://huggingface.co/barandinho/qwen3.5-27b-tudum-dapo-50
## I. 引言
思维模型在给出最终答案之前会暴露中间文本。在TÜDÜM项目中,此行为被表示为一个思维块后跟一个最终响应:
> 中间推理轨迹 最终答案
这种输出格式改变了多语言问题。模型可以接收土耳其语提示并生成土耳其语最终答案,同时仍主要使用英语进行推理轨迹。这种行为对于使答案符合当地语言可能是可接受的。但这不是用土耳其语进行推理。这一区别对于教育、检查答案生成方式以及后续在土耳其语工作流程中使用至关重要。因为用户或评估者不仅看到最终答案,还会看到导致该答案的数学、科学或编码决策的顺序。
项目基准检查点是`unsloth/Qwen3.5-27B`。其模型卡片将`Qwen/Qwen3.5-27B`列为基座模型,并且官方Qwen3.5模型卡说明Qwen3.5模型默认以思维模式运行[1 (https://arxiv.org/html/2607.01927#bib.bib1), 2 (https://arxiv.org/html/2607.01927#bib.bib2)]。关于更广泛的Qwen系列背景,我们还引用了Qwen3技术报告[3 (https://arxiv.org/html/2607.01927#bib.bib3)]。先前关于思维链提示的工作表明,显式的中间步骤可以改善大语言模型中的复杂推理[4 (https://arxiv.org/html/2607.01927#bib.bib4)]。进一步的多语言思维链工作表明,在足够规模下,推理可以跨语言迁移[5 (https://arxiv.org/html/2607.01927#bib.bib5)]。然而,较新的分析也表明,即使输入和输出均非英语,多语言模型也可能使用以英语为中心的内部表示[6 (https://arxiv.org/html/2607.01927#bib.bib6)]。TÜDÜM正是受此差距驱动:仅凭土耳其语输出不足以证明模型在用土耳其语推理。
本文总结了TÜDÜM流程及其在项目评估套件上的测量行为。基础模型、分词器、聊天模板和评估框架的确切修订哈希值未包含在提供的项目文件中,属于可复现性待办项。贡献包括:
- • 一个土耳其语思维适配流程,包含土耳其语推理SFT及其后的GRPO系列RL;
- • 明确区分答案语言和推理轨迹语言;
- • 在数学、知识、科学、代码和指令遵循基准测试上,对基础模型、SFT和RL检查点进行实证比较;
- • 明确说明局限性以及恢复性能下降所需的未来RL环境。
## II. 方法
### II-A. 基础模型与思维格式
提供的项目报告中的基础模型是`unsloth/Qwen3.5-27B`,其模型卡片将`Qwen/Qwen3.5-27B`标识为基座。我们不重述项目文件中未提供的架构细节。操作上,该模型被用作思维模型:助手响应从``开始,接着是推理轨迹,以``结束,然后输出最终答案。Qwen3.5模型卡片指出思维模式是默认的,并且Qwen3.5官方不支持Qwen3的`/think`和`/nothink`软开关;因此TÜDÜM设置将`...`视为观察到的结构化响应格式,而非一个单独验证过的开关机制[1 (https://arxiv.org/html/2607.01927#bib.bib1)]。
训练目标不仅仅是最终答案,而是一个结构化响应。该响应的第一部分预期包含土耳其语推理。这一框架很重要,因为否则模型可能仅通过翻译最后一个答案来满足土耳其语最终答案要求。在TÜDÜM中,被训练的行为是使思维块内部类似草稿本的文本保持土耳其语,除非数学符号、代码或符号使得语言分类变得无关紧要。图1 (https://arxiv.org/html/2607.01927#S2.F1) 总结了最终的基础模型–SFT–RL流程。
Base Qwen3.5-27B → SFT 土耳其语推理 → RL GRPO 数学奖励
图1:TÜDÜM训练流程。贡献在于完整的适配和评估流程,而非一个独立的训练数据集。
### II-B. 监督微调
监督微调(SFT)通过最大化期望助手响应的似然来训练模型模仿目标补全,如同在监督演示之后进行偏好或RL阶段的指令微调流程[7 (https://arxiv.org/html/2607.01927#bib.bib7)]。在该项目中,SFT用于教导一种响应风格:思维块内的土耳其语推理,后跟最终答案。这与仅训练土耳其语答案格式化器不同。对于土耳其语提示xxx和目标助手토큰 y1:Ty_{1:T},带掩码的SFT目标可以写为:
LSFT(θ) = -∑_{t=1}^{T} m_t log pθ(y_t | x, y_{<t})
因此损失直接覆盖推理轨迹。
最终的SFT数据集包含15,991个示例。其构成如表一 (https://arxiv.org/html/2607.01927#S2.T1) 所示。数学在数据集中占主导地位,但科学、代码和系统提示示例被特意仅包含在SFT中,以相对于RL阶段拓宽行为。
**表一:最终SFT数据集构成。** 数值来自提供的实验文档。
数学子集是从公开的`barandinho/DAPO-Math-14k-Turkish`数据集[8 (https://arxiv.org/html/2607.01927#bib.bib8)]中,使用DeepSeek-V3.2教师模型[9 (https://arxiv.org/html/2607.01927#bib.bib9)]生成的,并经过提示质量、土耳其语推理语言和`math_verify`正确性[10 (https://arxiv.org/html/2607.01927#bib.bib10)]过滤。报告的流程为:12,368次成功生成,10,876个土耳其语推理候选,9,574个正确示例,以及最终去重后的9,566行。科学子集是从土耳其语科学提示中生成,并用Kimi-K2.5[11 (https://arxiv.org/html/2607.01927#bib.bib11)]进行判断,产生5,134个最终行。代码子集同样使用了项目教师生成路径和Kimi-K2.5正确性过滤,产生652个最终行。这些教师和判断模型的详细信息在此仅作为项目方法论报告,并非声称所得数据无判断噪声。
### II-C. LoRA适配
SFT阶段使用LoRA而非全参数微调。LoRA冻结原始大权重矩阵,并训练低秩适配矩阵,其乘积提供更新[12 (https://arxiv.org/html/2607.01927#bib.bib12)]。对于基础矩阵 W ∈ R^{d_out × d_in},适配后的矩阵为:
W' = W + ΔW, ΔW = (α/r) BA (2)
其中 A ∈ R^{r × d_in} 和 B ∈ R^{d_out × r} 被训练,而 W 保持冻结。与更新整个27B模型相比,这大大减少了可训练参数的数量。提供的报告指定LoRA秩 r=64,alpha α=64,dropout=0。SFT设置使用4个H200 GPU、带有TRL SFTTrainer的Unsloth、最大序列长度32,768、5个周期、学习率2×10^{-4}(余弦调度)和有效批量大小16。
### II-D. GRPO系列强化学习
RL阶段没有重用整个SFT混合数据集。它使用了一个独立的数学环境,源自项目的DAPO-Math Turkish 5k数据集。一个Qwen3.5-4B代理模型为每个问题生成12个补全。每个补全都使用`math_verify`对照标准答案进行检查。对于提示 iii,代理通过率为:
ppr_i = (1/12) ∑_{k=1}^{12} 1{verify(c_{i,k}, a_i) = 1} (3)
代理通过率为0或1的问题被移除;只有 0 < ppr_i < 1 的问题保留下来。这移除了那些在3.5-4B模型下要么总是可解决要么总是不可解决的问题。
RL训练使用了GRPO系列的自适应课程变体[14 (https://arxiv.org/html/2607.01927#bib.bib14), 15 (https://arxiv.org/html/2607.01927#bib.bib15), 16 (https://arxiv.org/html/2607.01927#bib.bib16)]。对于提示,RL策略生成一个补全。数学奖励 [`r_math`] 通过 `math_verify` 提供二元正确性信号:
r_math = 1{verify(response, answer) = 1} (4)
附加的格式和语言奖励项在训练期间用来指导输出结构:
`lang_turkish` 权重0.5:惩罚不包含土耳其语字符的响应,规则基于正则表达式检查。
`no_chinese` 权重0.3:惩罚包含中文字符的响应,规则基于 `re.search`,该搜索被表述为“无”权重惩罚。
`soft_overlong` 权重0.2:线性长度惩罚,范围在[-1, 0]。
总奖励 `R_total` 是 `r_math * 1.0 + lang_turkish + no_chinese + soft_overlong`。这种奖励函数更新由自适应GRPO变体调度,并使用Qwen3.5-4B模型作为参考策略,用于GRPO的优势归一化和KL惩罚。
## III. 评估
本研究比较了基础模型、SFT检查点以及第50、100、150、200、250和300步的RL检查点。评估套件并非只关注单一类型的任务。它衡量不同的能力。AIME24和AIME25衡量竞赛风格数学推理。土耳其语MMLU衡量土耳其语的一般知识和问题解决能力,遵循MMLU风格的评估格式[17 (https://arxiv.org/html/2607.01927#bib.bib17), 18 (https://arxiv.org/html/2607.01927#bib.bib18)]。GPQA衡量研究生水平的科学问答能力[19 (https://arxiv.org/html/2607.01927#bib.bib19)]。HumanEval衡量生成的代码是否正确工作[20 (https://arxiv.org/html/2607.01927#bib.bib20)]。IFEval衡量模型是否能遵循具有清晰可检查规则的指令[21 (https://arxiv.org/html/2607.01927#bib.bib21)];在该项目中,报告了提示级别和指令级别的IFEval分数。
宏观-6是六项测试的平均分:AIME24、AIME25、土耳其语MMLU、GPQA、HumanEval和IFEval提示分:
Macro-6 = (1/6) (s_{A24} + s_{A25} + s_{MMLU} + s_{GPQA} + s_{HE} + s_{IFp}) (7)
IFEval指令分数不包含在此平均值中,而是作为额外的诊断分数单独报告。
## IV. 结果
表三 (https://arxiv.org/html/2607.01927#S4.T3) 显示了主要比较。RL列仅使用一个检查点:第50步。这是因为在记录的RL检查点中,第50步的宏观-6平均分最高。每个单独基准测试的最佳检查点未用于主要比较。这些检查点作为诊断证据单独报告在表四 (https://arxiv.org/html/2607.01927#S4.T4) 中。
最明确的结果是,SFT改进了目标语言行为,但降低了基准测试准确率。基础模型的宏观-6分数为81.7。SFT模型的宏观-6分数为75.8。第50步的RL达到了78.1的宏观-6分数。因此,RL恢复了SFT导致的性能损失的一部分。然而,在报告的宏观平均值上,RL的表现并未优于基础模型。
**表三:主要基础模型、SFT和RL比较。** 分数为百分比准确率。RL第50步是根据宏观-6分数单次选定的。
**表四:按步骤划分的诊断性RL检查点分数。** 分数为百分比准确率;“最佳”列是按基准测试划分的,不用于主要模型比较。
### IV-A. SFT效果
SFT阶段的主要效果是行为上的。提供的报告称,基础Qwen3.5-27B检查点倾向于在难题上切换到英语。相比之下,SFT模型基本停止了这种行为。它开始产生更受控的土耳其语推理。从这个意义上说,该项目将可见行为从土耳其语最终答案本地化转变为土耳其语可见推理。定量上,表五 (https://arxiv.org/html/2607.01927#S4.T5) 显示了响应长度和思维耗竭率的大幅降低。AIME24平均响应长度从7,163个词减少到4,202个词,土耳其语MMLU从1,266个词减少到404个词,IFEval从1,752个词减少到330个词。思维耗竭率也有所下降:AIME24从15.6%降至2.2%,AIME25从20.0%降至7.8%。
**表五:SFT后的推理长度和思维耗竭率指标。** 数值来自提供的实验文档。
不应将这些长度变化纯粹解读为语言学上的变化。教师数据是在受控输出预算下生成的,包括一个4,096令牌的思维后补全预算和一个28,672令牌的数学和科学生成思维预算。由于SFT在32K上下文中优化了从 `` 开始的助手响应,模型很可能同时学习了土耳其语推理风格和教师数据中较短的草稿本分布。
### IV-B. RL效果
RL改善了一些数学行为,但并非所有基准测试。第50步产生了最强的总体RL结果和最佳的AIME24结果:86.7%,在该基准测试上超过了基础模型和SFT。第50步的AIME25也从SFT的67.8%提高到72.2%,但仍低于基础模型的74.4%。诊断性检查点表格显示,某些基准测试在较后步骤达到了最佳分数。GPQA在第150步达到了最佳分数72.3%。土耳其语MMLU在第200步达到了最佳分数79.7%。IFEval在第100步达到了最佳分数。这些单个基准测试的最佳分数有助于理解训练随时间的变化情况。然而,它们不被视为一个单一的可部署模型。
IFEval提示分数仅恢复了SFT导致损失的一小部分。基础模型在IFEval提示上得分为88.6%。SFT模型得分为72.9%。最佳诊断性RL检查点达到了75.7%。
因此,结果支持一个有限的结论:经过代理过滤的数学RL可以恢复,有时甚至可以提高土耳其语推理SFT后的数学性能,但纯数学的RL环境并不能统一恢复广泛的能力或指令遵循能力。这与研究设计一致。RL环境有意设计得比SFT数据集更狭窄。
## V. 讨论
TÜDÜM应被视为一个用于控制大语言模型中显式推理语言的项目。本研究的目的不仅在于提高最终答案的准确性,还在于使推理过程在土耳其语中更稳定、更透明、更可用。这一点很重要,因为土耳其语教育、科学和编码工作流程需要能够用土耳其语推理的模型,而不是仅将最终答案翻译成土耳其语的模型。
结果显示,SFT阶段主要改变了模型的行为。SFT之后,模型在生成土耳其语推理轨迹方面变得更加一致。这意味着监督微调可以教导模型预期的推理语言。然而,这是以基准测试性能下降为代价的。第50步的RL改善了一些基准测试,尤其是AIME24,可能反映出数学格式化任务相对于简单的土耳其语语言使用,更受益于数学奖励。SFT后指令遵循分数(IFEval)的下降仅得到部分恢复,这表明纯粹的数学RL并没有直接训练指令遵循能力。
主要的贡献在于方法方面,而非绝对的性能水平。首先,通过SFT和RL进行土耳其语思维的行为训练在原则上是可行的。其次,基础模型、SFT和RL检查点之间的直接比较为未来的工作提供了经验基线。第三,答案语言和推理语言之间的分离为多语言推理研究提供了有用的评估标准。局限性是双重的。生成的基准测试表现仍低于基础模型宏观-6平均分。第50步的RL恢复并未在所有基准测试上持续。此外,未来工作应探索包括指令遵循、科学和安全在内的更广泛的RL环境。相似文章
向思维模型教授工具推理:工具集成推理的全流程方案
本文提出了一种全流程方案,用于向思维模型教授工具推理,该方法应用于 Qwen3 模型时,在 AIME 2025 等基准测试上实现了最先进的性能。
用于小型语言模型算术微调的结构化合成推理数据
本文研究了在消费级硬件限制下,结构化合成推理数据是否能提升小型语言模型的算术推理能力。使用基于GSM8K的合成语料库,通过LoRA对Qwen3-0.6B和Qwen3-1.7B进行微调,精确匹配准确率提升了12-13个百分点,并在相关基准测试中表现出较强的迁移能力。
医疗模型:Reasoning-Medical-27B (Qwen3.6-27B微调)
Reasoning-Medical-27B 是一个基于 Qwen3.6-27B 微调的高级医学推理模型,使用 GRPO 和 Unsloth 优化方法,在 37 万个问答示例上通过思维链推理进行训练。
Tess-4-27B by Migel Tissera
Tess-4-27B 是一个基于 Qwen3.6-27B 构建的 27B 推理模型,在 64K 令牌长上下文智能体轨迹上进行了后训练,并采用了权重缩放推理。它旨在实现高效、诚实和智能体的任务执行,并以开源格式提供。
基于领域特定知识图谱的面向旅游的推理大语言模型
本文提出一个模块化流水线,使用领域特定知识图谱生成多跳问答对,并微调一个面向旅游领域的推理大语言模型 (Qwen3-4B),实现了82.4%的精确匹配准确率,显著优于基线模型。