empero-ai/Qwen3.8-9B-Distill

Hugging Face Models Trending 模型

摘要

Qwen3.8-9B-Distill 是 Qwen3.8 2.4T A95B 模型的蒸馏版本,采用 9B 架构,基于精选的教师轨迹训练,以增强数学和代码推理能力,显示出基准性能的提升。

任务:文本生成 标签:Transformer, safetensors, qwen3_5, 图像文本生成, empero-ai, qwen3.5, qwen3.8, 蒸馏, 推理, 函数调用, 监督微调, 文本生成, 对话式, 英语, 基础模型:Qwen/Qwen3.5-9B, 基础模型:微调:Qwen/Qwen3.5-9B, 许可证:Apache-2.0, 端点兼容, 区域:美国
查看原文
查看缓存全文

缓存时间: 2026/08/22 21:58

empero-ai/Qwen3.8-9B-Distill · Hugging Face 来源:https://huggingface.co/empero-ai/Qwen3.8-9B-Distill

https://huggingface.co/empero-ai/Qwen3.8-9B-Distill#qwen38-9bQwen3.8-9B

由 Empero 开发 (https://empero.org/)

本仓库包含 Hugging Face Transformers 格式的模型权重和配置文件。这些工件与 Hugging Face Transformers、vLLM、SGLang 以及其他支持 Qwen3.5 架构的标准运行时兼容。

Qwen3.8-9BQwen3.8 2.4T A95B 到 Qwen3.5-9B 架构的全参数蒸馏版。学生模型使用了我们内部 Qwen3.8 蒸馏数据集中的约 70,000 条精选教师轨迹进行训练——这些密集的思维链涵盖了数学、代码、通用推理、指令遵循和工具使用,在训练前经过质量筛选。其目标是将前沿规模教师的推理行为引入一个可部署在单张 GPU 上的密集 9B 模型中。

https://huggingface.co/empero-ai/Qwen3.8-9B-Distill#highlights亮点

  • 蒸馏的思维链 —— 每个答案都以一个 `` 块开头,该块直接从 Qwen3.8 2.4T A95B 的轨迹中学习,而非合成自生成推理。
  • 数学和代码重点 —— 轨迹混合有意侧重于高难度数学和竞赛编程,这是在此规模下蒸馏效果最显著的领域。
  • 原生函数调用 —— 符合 Qwen3.5 的规范,无需包装器或特定工具的微调。
  • 262,144 词元的原生上下文长度 —— 继承自 Qwen3.5 基座。
  • 全量微调 —— 更新了每个参数,而非仅适配器。

https://huggingface.co/empero-ai/Qwen3.8-9B-Distill#model-overview模型概述

  • 类型:因果语言模型(视觉-语言基础模型的文本路径)
  • 基座:Qwen/Qwen3.5-9B (https://huggingface.co/Qwen/Qwen3.5-9B)
  • 参数量:9B
  • 训练:在约 70,000 条教师轨迹上进行 SFT(离策略蒸馏)
  • 教师:Qwen3.8 2.4T A95B(内部蒸馏数据集)
  • 上下文长度:原生支持 262,144

https://huggingface.co/empero-ai/Qwen3.8-9B-Distill#benchmark-results基准测试结果

使用 lm-evaluation-harness (https://github.com/EleutherAI/lm-evaluation-harness) 测量,采用 HF 后端,基座和学生模型使用相同设置。两个模型都是推理模型,并使用 CoT 协议(gsm8k_cotmmlu_flan_cot_zeroshot)进行评估;MMLU 涵盖全部 57 个科目(约 1,700 个问题)。灵活提取是主要指标;严格匹配要求答案格式完全一致。

任务指标Qwen3.5-9B (基座)Qwen3.8-9BΔ
gsm8k_cotexact_match (flexible)0.8850.870-0.015
gsm8k_cotexact_match (strict)0.8750.850-0.025
mmlu (CoT, 57 subjects)acc (flexible-extract)0.5460.751+0.205
mmlu (CoT, 57 subjects)acc (strict-match)0.2510.511+0.260

生成采样参数:temperature=0.6, top_p=0.95, top_k=20(Qwen3.5 推荐设置)。

https://huggingface.co/empero-ai/Qwen3.8-9B-Distill#quickstart快速开始

from transformers import AutoModelForCausalLM, AutoTokenizer
import torch

model_id = "empero-ai/Qwen3.8-9B"
tok = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(model_id, dtype=torch.bfloat16, device_map="auto")

messages = [{"role": "user", "content": "一只蜗牛位于 10 米深的井底。它白天爬 3 米,晚上滑下 2 米。它需要多少天才能爬出井?"}]
inputs = tok.apply_chat_template(messages, add_generation_prompt=True, return_tensors="pt").to(model.device)
out = model.generate(inputs, max_new_tokens=16384, temperature=0.6, top_p=0.95, top_k=20, do_sample=True)
print(tok.decode(out[0][inputs.shape[1]:], skip_special_tokens=True))

需要支持 Qwen3.5 的近期 transformers 版本,以及 Gated DeltaNet 内核(flash-linear-attention (https://github.com/fla-org/flash-linear-attention) 和与 CUDA 匹配的 causal_conv1d (https://github.com/Dao-AILab/causal-conv1d) 构建)——缺少它们,线性注意力层将回退到缓慢、消耗内存的 PyTorch 操作。

https://huggingface.co/empero-ai/Qwen3.8-9B-Distill#best-practices最佳实践

  • 采样temperature=0.6, top_p=0.95, top_k=20。对于此类推理模型,长生成中使用贪婪解码是已知的重复循环失败模式。
  • 输出长度:允许充足的 max_new_tokens(推荐 16,384);每个答案都以一个 `` 块开头。请为最终用户解析并剥离 </think> 区间。
  • 范围:模型是从教师轨迹中学习的,而非自身的运行——它继承了教师的推理风格,包括偶尔在简单问题上过度冗长的思考。此次微调仅涉及文本;视觉行为继承自基座模型,此处未进行评估。

https://huggingface.co/empero-ai/Qwen3.8-9B-Distill#stay-in-the-loop保持关注

empero.org (https://empero.org/) 注册 Empero 新闻通讯,以获取发布、评估和研究笔记。

https://huggingface.co/empero-ai/Qwen3.8-9B-Distill#support–donate支持/捐赠

如果此模型对您有所帮助,请考虑支持该项目:

  • BTCbc1qx6zepu6sfkvshgdmc4ewu6pk6rpadvpgffpp7v
  • LTCltc1qv2mefzps2vtjcpwfx8xxdrpplrcvltswm68r7x

https://huggingface.co/empero-ai/Qwen3.8-9B-Distill#provenance–licensing来源与许可

权重以 Apache-2.0 许可发布,继承自 Qwen3.5-9B 基座。为研究和实验目的共享,按原样提供。

https://huggingface.co/empero-ai/Qwen3.8-9B-Distill#acknowledgements致谢

  • 开发并发布:Empero (https://empero.org/)
  • 基座模型:Qwen3.5-9B (https://huggingface.co/Qwen/Qwen3.5-9B) (阿里巴巴 Qwen 团队)
  • 训练:TRL (https://github.com/huggingface/trl) + Transformers (https://github.com/huggingface/transformers)
  • 线性注意力内核:flash-linear-attention (https://github.com/fla-org/flash-linear-attention), causal_conv1d (https://github.com/Dao-AILab/causal-conv1d)
  • 评估:lm-evaluation-harness (https://github.com/EleutherAI/lm-evaluation-harness) (EleutherAI)

相似文章

Qwen 3.8 蒸馏

Reddit r/LocalLLaMA

一条推文分享了关于Qwen 3.8 AI模型蒸馏的信息链接,发布者注明未亲自测试。

Qwen/Qwen3.6-35B-A3B-FP8

Hugging Face Models Trending

阿里巴巴发布了Qwen3.6-35B-A3B-FP8,这是Qwen3.6的开源权重量化变体,拥有35B参数,通过MoE激活3B,具有改进的智能编码能力和保持思维链的迭代开发特性。

Qwen/Qwen3.6-35B-A3B

Hugging Face Models Trending

Qwen 发布 Qwen3.6-35B-A3B,一款开源权重的混合专家(MoE)模型,总参数量 35B,激活参数量 3B,在智能体编码和推理能力保持方面实现显著提升。