empero-ai/Qwen3.8-9B-Distill
摘要
Qwen3.8-9B-Distill 是 Qwen3.8 2.4T A95B 模型的蒸馏版本,采用 9B 架构,基于精选的教师轨迹训练,以增强数学和代码推理能力,显示出基准性能的提升。
查看缓存全文
缓存时间: 2026/08/22 21:58
empero-ai/Qwen3.8-9B-Distill · Hugging Face 来源:https://huggingface.co/empero-ai/Qwen3.8-9B-Distill
https://huggingface.co/empero-ai/Qwen3.8-9B-Distill#qwen38-9bQwen3.8-9B
由 Empero 开发 (https://empero.org/)
本仓库包含 Hugging Face Transformers 格式的模型权重和配置文件。这些工件与 Hugging Face Transformers、vLLM、SGLang 以及其他支持 Qwen3.5 架构的标准运行时兼容。
Qwen3.8-9B 是Qwen3.8 2.4T A95B 到 Qwen3.5-9B 架构的全参数蒸馏版。学生模型使用了我们内部 Qwen3.8 蒸馏数据集中的约 70,000 条精选教师轨迹进行训练——这些密集的思维链涵盖了数学、代码、通用推理、指令遵循和工具使用,在训练前经过质量筛选。其目标是将前沿规模教师的推理行为引入一个可部署在单张 GPU 上的密集 9B 模型中。
https://huggingface.co/empero-ai/Qwen3.8-9B-Distill#highlights亮点
- 蒸馏的思维链 —— 每个答案都以一个 `` 块开头,该块直接从 Qwen3.8 2.4T A95B 的轨迹中学习,而非合成自生成推理。
- 数学和代码重点 —— 轨迹混合有意侧重于高难度数学和竞赛编程,这是在此规模下蒸馏效果最显著的领域。
- 原生函数调用 —— 符合 Qwen3.5 的规范,无需包装器或特定工具的微调。
- 262,144 词元的原生上下文长度 —— 继承自 Qwen3.5 基座。
- 全量微调 —— 更新了每个参数,而非仅适配器。
https://huggingface.co/empero-ai/Qwen3.8-9B-Distill#model-overview模型概述
- 类型:因果语言模型(视觉-语言基础模型的文本路径)
- 基座:Qwen/Qwen3.5-9B (https://huggingface.co/Qwen/Qwen3.5-9B)
- 参数量:9B
- 训练:在约 70,000 条教师轨迹上进行 SFT(离策略蒸馏)
- 教师:Qwen3.8 2.4T A95B(内部蒸馏数据集)
- 上下文长度:原生支持 262,144
https://huggingface.co/empero-ai/Qwen3.8-9B-Distill#benchmark-results基准测试结果
使用 lm-evaluation-harness (https://github.com/EleutherAI/lm-evaluation-harness) 测量,采用 HF 后端,基座和学生模型使用相同设置。两个模型都是推理模型,并使用 CoT 协议(gsm8k_cot、mmlu_flan_cot_zeroshot)进行评估;MMLU 涵盖全部 57 个科目(约 1,700 个问题)。灵活提取是主要指标;严格匹配要求答案格式完全一致。
| 任务 | 指标 | Qwen3.5-9B (基座) | Qwen3.8-9B | Δ |
|---|---|---|---|---|
| gsm8k_cot | exact_match (flexible) | 0.885 | 0.870 | -0.015 |
| gsm8k_cot | exact_match (strict) | 0.875 | 0.850 | -0.025 |
| mmlu (CoT, 57 subjects) | acc (flexible-extract) | 0.546 | 0.751 | +0.205 |
| mmlu (CoT, 57 subjects) | acc (strict-match) | 0.251 | 0.511 | +0.260 |
生成采样参数:temperature=0.6, top_p=0.95, top_k=20(Qwen3.5 推荐设置)。
https://huggingface.co/empero-ai/Qwen3.8-9B-Distill#quickstart快速开始
from transformers import AutoModelForCausalLM, AutoTokenizer
import torch
model_id = "empero-ai/Qwen3.8-9B"
tok = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(model_id, dtype=torch.bfloat16, device_map="auto")
messages = [{"role": "user", "content": "一只蜗牛位于 10 米深的井底。它白天爬 3 米,晚上滑下 2 米。它需要多少天才能爬出井?"}]
inputs = tok.apply_chat_template(messages, add_generation_prompt=True, return_tensors="pt").to(model.device)
out = model.generate(inputs, max_new_tokens=16384, temperature=0.6, top_p=0.95, top_k=20, do_sample=True)
print(tok.decode(out[0][inputs.shape[1]:], skip_special_tokens=True))
需要支持 Qwen3.5 的近期 transformers 版本,以及 Gated DeltaNet 内核(flash-linear-attention (https://github.com/fla-org/flash-linear-attention) 和与 CUDA 匹配的 causal_conv1d (https://github.com/Dao-AILab/causal-conv1d) 构建)——缺少它们,线性注意力层将回退到缓慢、消耗内存的 PyTorch 操作。
https://huggingface.co/empero-ai/Qwen3.8-9B-Distill#best-practices最佳实践
- 采样:
temperature=0.6, top_p=0.95, top_k=20。对于此类推理模型,长生成中使用贪婪解码是已知的重复循环失败模式。 - 输出长度:允许充足的
max_new_tokens(推荐 16,384);每个答案都以一个 `` 块开头。请为最终用户解析并剥离</think>区间。 - 范围:模型是从教师轨迹中学习的,而非自身的运行——它继承了教师的推理风格,包括偶尔在简单问题上过度冗长的思考。此次微调仅涉及文本;视觉行为继承自基座模型,此处未进行评估。
https://huggingface.co/empero-ai/Qwen3.8-9B-Distill#stay-in-the-loop保持关注
在 empero.org (https://empero.org/) 注册 Empero 新闻通讯,以获取发布、评估和研究笔记。
https://huggingface.co/empero-ai/Qwen3.8-9B-Distill#support–donate支持/捐赠
如果此模型对您有所帮助,请考虑支持该项目:
- BTC:
bc1qx6zepu6sfkvshgdmc4ewu6pk6rpadvpgffpp7v - LTC:
ltc1qv2mefzps2vtjcpwfx8xxdrpplrcvltswm68r7x
https://huggingface.co/empero-ai/Qwen3.8-9B-Distill#provenance–licensing来源与许可
权重以 Apache-2.0 许可发布,继承自 Qwen3.5-9B 基座。为研究和实验目的共享,按原样提供。
https://huggingface.co/empero-ai/Qwen3.8-9B-Distill#acknowledgements致谢
- 开发并发布:Empero (https://empero.org/)
- 基座模型:Qwen3.5-9B (https://huggingface.co/Qwen/Qwen3.5-9B) (阿里巴巴 Qwen 团队)
- 训练:TRL (https://github.com/huggingface/trl) + Transformers (https://github.com/huggingface/transformers)
- 线性注意力内核:flash-linear-attention (https://github.com/fla-org/flash-linear-attention), causal_conv1d (https://github.com/Dao-AILab/causal-conv1d)
- 评估:lm-evaluation-harness (https://github.com/EleutherAI/lm-evaluation-harness) (EleutherAI)
相似文章
Qwen 3.8 蒸馏
一条推文分享了关于Qwen 3.8 AI模型蒸馏的信息链接,发布者注明未亲自测试。
hesamation/Qwen3.6-35B-A3B-Claude-4.6-Opus-Reasoning-Distilled-GGUF
一个 35B 参数的 Qwen3.6 模型,使用 Claude-Opus 风格的思维链蒸馏数据微调,并以 GGUF 量化格式发布,可在本地高效推理。
Qwen/Qwen3.6-35B-A3B-FP8
阿里巴巴发布了Qwen3.6-35B-A3B-FP8,这是Qwen3.6的开源权重量化变体,拥有35B参数,通过MoE激活3B,具有改进的智能编码能力和保持思维链的迭代开发特性。
Qwen/Qwen3.6-35B-A3B
Qwen 发布 Qwen3.6-35B-A3B,一款开源权重的混合专家(MoE)模型,总参数量 35B,激活参数量 3B,在智能体编码和推理能力保持方面实现显著提升。
关于用于本地编码的 Qwen-3.6 14B 和 9B 蒸馏模型有任何消息(或希望)吗?
作者询问是否有针对本地编码用途的 Qwen-3.6 模型 9B 和 14B 蒸馏变体,并提到了在有限硬件上使用 Qwen-3.5 9B 时遇到的具体工具调用和文件结构问题。