@kaiostephens: 又一个!介绍 Grug-30b-a3b!Grug 是一个基于 Qwen-3.6-30b-a3b 构建的开源实验模型。D…
摘要
Grug-35B-A3B 是一个基于 Qwen-3.6-35B-A3B 的开源实验模型,可将推理 token 使用量减少约 69.8%,同时将答案质量维持在基础模型的 2% 以内,从而实现更快的生成速度和更少的上下文使用。
查看缓存全文
缓存时间: 2026/07/03 14:39
又一个新模型!隆重介绍 Grug-30b-a3b!
Grug 是一个基于 Qwen-3.6-30b-a3b 构建的开源实验性模型,旨在通过将思考过程精简为仅必要的部分,来复制 GPT-5.5 的效率。Grug 平均减少约 69.8% 的推理令牌输出,同时性能与基础 Qwen-3.6 的总体差距在约 2% 以内。这带来了显著更快的生成速度和更少的上下文占用,从而导致生成速度呈指数级提升。
在此处下载:https://huggingface.co/kai-os/Grug-35B-A3B
kai-os/Grug-35B-A3B · Hugging Face
来源:https://huggingface.co/kai-os/Grug-35B-A3B
Grug 35B A3B banner (https://huggingface.co/kai-os/Grug-35B-A3B/blob/main/banner.png)
Grug 35B A3B 是 Qwen/Qwen3.6-35B-A3B 的一个紧凑推理微调版本。它保留了 Qwen MoE/A3B 架构:总参数量为 35B,每个令牌激活约 3B 参数,40 个文本层,256 个专家,每个令牌有 8 个路由专家以及共享专家路径。
本仓库以合并后的 Transformers/safetensors 模型权重形式发布。它通过 QLoRA/PEFT LoRA 进行训练,并在上传前合并到基础模型中。加载此模型无需单独的适配器。
https://huggingface.co/kai-os/Grug-35B-A3B#what-changed 变化内容
训练目标是形成一种简洁的内部推理风格:简短的高密度笔记,减少填充短语,并更有效地保留约束、公式、检查、错误原因、决定性分支、边界情况和最终答案验证。目标是在保持答案质量的同时,相比基础模型降低推理令牌的使用量。这并非旨在隐藏不确定性或移除必要的推理过程。
https://huggingface.co/kai-os/Grug-35B-A3B#architecture 架构
合并发布的是一个 Qwen MoE 文本生成模型:
- 基础模型:
Qwen/Qwen3.6-35B-A3B。 - 发布架构:
Qwen3_5MoeForCausalLM。 - 模型类型:
qwen3_5_moe_text。 - 隐藏层大小:2048。
- 文本层数:40。
- 专家数:256。
- 激活专家:8 个路由专家加上共享专家路径。
- 基础模型系列的原生上下文长度:262,144 个令牌。
https://huggingface.co/kai-os/Grug-35B-A3B#training-data 训练数据
数据处理流程始于一个近期筛选的推理数据池,并将冗长的推理轨迹转换为紧凑轨迹,然后进行 SFT 打包。
来源筛选条件:
- 运行日期:2026 年 6 月 30 日。
- 默认新鲜度截止时间:45 天。2026 年 5 月 16 日之前的数据源将被拒绝,除非手动允许。
- 允许的训练许可证:MIT、Apache-2.0、CC-BY-4.0、CC0-1.0。
- 严格拒绝的条款包括:OpenAI、ChatGPT、GPT-5、Claude、Anthropic、Opus、Sonnet 和 Gemini。
- 标记为合成/蒸馏的中风险来源会根据来源和许可证进行人工审查或拒绝。
最终验证的数据源混合:
| 来源 | 许可证 | 领域 | 已验证行数 |
|---|---|---|---|
hotdogs/uka-glm-5.2 | MIT | 代理代码 | 1,617 |
Scale-or-Reason/general-reasoning-ift-pairs | MIT | 通用推理 | 1,305 |
samcheng0/lumia-reasoning-sft-v1 | Apache-2.0 | 代码推理 | 1,103 |
HSH-Intelligence/verified-math-reasoning-3k | Apache-2.0 | 数学 | 672 |
kd13/CodeDebug-Instruct-v2-Reasoning | MIT | 代码调试 | 600 |
Madarabr/cortex-adaptive-thinking | Apache-2.0 | 自适应推理 | 300 |
CL-From-Nothing/code_rose_initial_1_7B_SFT_10K_rollouts_Qwen3-4B-Thinking-2507_k12_t0.7_maxtok12288 | Apache-2.0 | 代码推理 | 143 |
行数统计:
- 标准化近期推理池:8,680 行。
- 选定的冗长推理集:6,144 行。
- 紧凑原始转换输出:6,144 行。
- 清理后的打包 SFT 分片:4,517 训练 / 245 验证 / 247 测试。
- 经过长度过滤后接受的 Qwen 训练行:4,385。
- 被长度过滤跳过的 Qwen 训练行:132。
- 训练期间使用的评估行:64。
紧凑推理转换由 cyankiwi/Qwen3.6-35B-A3B-AWQ-4bit 通过 vLLM 服务生成。在训练前,对行的压缩比、答案保留、格式错误标签、重复、固定推理标签、语气问题以及关键信息明显丢失等情况进行了检查。
https://huggingface.co/kai-os/Grug-35B-A3B#training-procedure 训练过程
训练是纯完成式的 SFT:提示令牌被 -100 屏蔽,仅训练助手的完成部分。
核心设置:
- 基础模型:
Qwen/Qwen3.6-35B-A3B。 - 方法:QLoRA / PEFT LoRA,训练后合并到完整的模型权重中上传。
- 训练期间量化:4 位 NF4,BF16 计算。
- 硬件:8x NVIDIA Tesla V100-SXM2 16GB。
- 最大序列长度:1,792。
- LoRA 秩:4。
- LoRA alpha:8。
- 批次大小:1。
- 梯度累积:4。
- 学习率:8e-5。
- 最大步数:100。
- 评估步长:25。
- 保存步长:25。
- 训练运行时间:约 1 小时 41 分钟 44 秒。
- 每秒训练样本数:0.066。
- 每秒训练步数:0.016。
- 训练损失:1.051。
验证损失:
| 步数 | 评估损失 |
|---|---|
| 25 | 1.1510 |
| 50 | 1.0793 |
| 75 | 1.0487 |
| 100 | 1.0399 |
https://huggingface.co/kai-os/Grug-35B-A3B#local-smoke-test 本地烟雾测试
最终检查点的烟雾测试输出紧凑,并且没有使用固定的 目标/规则/逻辑/边界 标签。
示例:
衬衫 80 美元,25% 折扣。80 的 25% = 20。80 - 20 = 60。检查:60/80 = 0.75。正确。答案 60。售价为 60 美元。
Bug 修复烟雾测试正确地将 len(x) 识别为问题并将其更改为 len(xs)。
这只是一个烟雾测试,并非全面的基准测试。在将模型用于敏感或生产环境之前,请自行运行评估。
https://huggingface.co/kai-os/Grug-35B-A3B#usage 使用方法
import torch
from transformers import AutoModelForCausalLM, AutoTokenizer
model_id = "kai-os/Grug-35B-A3B"
tokenizer = AutoTokenizer.from_pretrained(model_id, trust_remote_code=True)
model = AutoModelForCausalLM.from_pretrained(
model_id,
torch_dtype=torch.bfloat16,
device_map="auto",
trust_remote_code=True,
)
model.eval()
messages = [
{"role": "user", "content": "If a shirt is $80 and goes 25% off, what is the sale price?"}
]
inputs = tokenizer.apply_chat_template(
messages,
return_tensors="pt",
add_generation_prompt=True,
).to(model.device)
with torch.no_grad():
output = model.generate(inputs, do_sample=False, max_new_tokens=512)
print(tokenizer.decode(output[0], skip_special_tokens=True))
对于令牌效率测试,请使用相同的提示和解码设置与基础模型进行比较。除非部署本身需要,否则不要为基准测试声明使用人为的生成上限。
https://huggingface.co/kai-os/Grug-35B-A3B#limitations 局限
- 这是一个实验性的紧凑推理微调版本。
- 训练运行规模本就较小,应视为首个 Qwen/A3B 检查点,而非经过全面基准测试的生产模型。
- 在处理需要更长推导过程的任务时,它可能过度压缩推理。
- 它继承了基础模型的局限性和安全行为。
- 报告的评估是本地的且有限的。
- 数据集包含来自所列开源数据集的合成和蒸馏推理轨迹;在商业或敏感环境中使用前,请审核来源许可证和出处。
https://huggingface.co/kai-os/Grug-35B-A3B#acknowledgements 致谢
感谢 Lambda (https://lambda.com/) 推理提供商提供计算积分,以支持数据集工作、训练和评估。
kaios (@kaiostephens): 隆重介绍 ⭐Grug-12b!⭐
Grug 是一个基于 Gemma-4-12b 构建的开源实验性模型,旨在通过将思考过程精简为仅必要的部分,来复制 GPT-5.5 的效率。
Grug 平均减少约 69.8% 的推理令牌输出,同时性能保持在…
相似文章
@BrianRoemmele: 轰!看看这场开源领域对Anthropic的寒武纪大爆发式反击!来看看Qwythos 9B,一个基于Qwen3.5的GGUF,它…
Qwythos 9B 是一款新的开源、无审查推理模型,基于Qwen3.5,提供GGUF量化版本,拥有100万token上下文、视觉能力和函数调用功能,性能相比基础模型有显著提升。
Qwen3.6-27B-GGUF 重磅发布!
社区 GGUF 版本上线,Qwen 27B 混合架构模型支持 262K 上下文、多模态输入、工具调用,并保留“思考过程”,专为智能体编程而生。
@HuggingModels: 是否曾想过拥有一个结合了Qwen的推理能力、Opus的创造力以及GLM的高效性的模型?欢迎认识Qwen-3.5-Opus-GLM-27B…
Qwen-3.5-Opus-GLM-27B是一个270亿参数的GGUF合并模型,融合了Qwen的推理能力、Opus的创造力以及GLM的高效性,专为无需云依赖的高性能本地AI设计。
@WaleedAhmad1a10: 查看 Qwen 3.5 27B MoQ 的 GGUF 文件:
Hugging Face 仓库 (kaitchup/Qwen3.6-27B-GGUF-MoQ) 提供了 Qwen3.6-27B MoQ 模型的 GGUF 量化权重,支持使用 llama.cpp 和 Ollama 等工具进行本地推理。
Qwen/Qwen3.6-35B-A3B-FP8
阿里巴巴发布了Qwen3.6-35B-A3B-FP8,这是Qwen3.6的开源权重量化变体,拥有35B参数,通过MoE激活3B,具有改进的智能编码能力和保持思维链的迭代开发特性。