@kaiostephens: 又一个!介绍 Grug-30b-a3b!Grug 是一个基于 Qwen-3.6-30b-a3b 构建的开源实验模型。D…

X AI KOLs Timeline 模型

摘要

Grug-35B-A3B 是一个基于 Qwen-3.6-35B-A3B 的开源实验模型,可将推理 token 使用量减少约 69.8%,同时将答案质量维持在基础模型的 2% 以内,从而实现更快的生成速度和更少的上下文使用。

又一个! 介绍 Grug-30b-a3b! Grug 是一个基于 Qwen-3.6-30b-a3b 构建的开源实验模型。旨在通过将思考过程精简为仅必要的部分,复制 GPT-5.5 的效率。 Grug 平均输出的思考 token 减少约 69.8%,同时性能保持在基础 Qwen-3.6 的约 2% 误差范围内。 这使得生成速度显著提升,上下文占用减少,从而带来生成速度的指数级提升。 在此下载:https://huggingface.co/kai-os/Grug-35B-A3B…
查看原文
查看缓存全文

缓存时间: 2026/07/03 14:39

又一个新模型!隆重介绍 Grug-30b-a3b!

Grug 是一个基于 Qwen-3.6-30b-a3b 构建的开源实验性模型,旨在通过将思考过程精简为仅必要的部分,来复制 GPT-5.5 的效率。Grug 平均减少约 69.8% 的推理令牌输出,同时性能与基础 Qwen-3.6 的总体差距在约 2% 以内。这带来了显著更快的生成速度和更少的上下文占用,从而导致生成速度呈指数级提升。

在此处下载:https://huggingface.co/kai-os/Grug-35B-A3B


kai-os/Grug-35B-A3B · Hugging Face

来源:https://huggingface.co/kai-os/Grug-35B-A3B

Grug 35B A3B banner (https://huggingface.co/kai-os/Grug-35B-A3B/blob/main/banner.png)

Grug 35B A3B 是 Qwen/Qwen3.6-35B-A3B 的一个紧凑推理微调版本。它保留了 Qwen MoE/A3B 架构:总参数量为 35B,每个令牌激活约 3B 参数,40 个文本层,256 个专家,每个令牌有 8 个路由专家以及共享专家路径。

本仓库以合并后的 Transformers/safetensors 模型权重形式发布。它通过 QLoRA/PEFT LoRA 进行训练,并在上传前合并到基础模型中。加载此模型无需单独的适配器。

https://huggingface.co/kai-os/Grug-35B-A3B#what-changed 变化内容

训练目标是形成一种简洁的内部推理风格:简短的高密度笔记,减少填充短语,并更有效地保留约束、公式、检查、错误原因、决定性分支、边界情况和最终答案验证。目标是在保持答案质量的同时,相比基础模型降低推理令牌的使用量。这并非旨在隐藏不确定性或移除必要的推理过程。

https://huggingface.co/kai-os/Grug-35B-A3B#architecture 架构

合并发布的是一个 Qwen MoE 文本生成模型:

  • 基础模型:Qwen/Qwen3.6-35B-A3B
  • 发布架构:Qwen3_5MoeForCausalLM
  • 模型类型:qwen3_5_moe_text
  • 隐藏层大小:2048。
  • 文本层数:40。
  • 专家数:256。
  • 激活专家:8 个路由专家加上共享专家路径。
  • 基础模型系列的原生上下文长度:262,144 个令牌。

https://huggingface.co/kai-os/Grug-35B-A3B#training-data 训练数据

数据处理流程始于一个近期筛选的推理数据池,并将冗长的推理轨迹转换为紧凑轨迹,然后进行 SFT 打包。

来源筛选条件:

  • 运行日期:2026 年 6 月 30 日。
  • 默认新鲜度截止时间:45 天。2026 年 5 月 16 日之前的数据源将被拒绝,除非手动允许。
  • 允许的训练许可证:MIT、Apache-2.0、CC-BY-4.0、CC0-1.0。
  • 严格拒绝的条款包括:OpenAI、ChatGPT、GPT-5、Claude、Anthropic、Opus、Sonnet 和 Gemini。
  • 标记为合成/蒸馏的中风险来源会根据来源和许可证进行人工审查或拒绝。

最终验证的数据源混合:

来源许可证领域已验证行数
hotdogs/uka-glm-5.2MIT代理代码1,617
Scale-or-Reason/general-reasoning-ift-pairsMIT通用推理1,305
samcheng0/lumia-reasoning-sft-v1Apache-2.0代码推理1,103
HSH-Intelligence/verified-math-reasoning-3kApache-2.0数学672
kd13/CodeDebug-Instruct-v2-ReasoningMIT代码调试600
Madarabr/cortex-adaptive-thinkingApache-2.0自适应推理300
CL-From-Nothing/code_rose_initial_1_7B_SFT_10K_rollouts_Qwen3-4B-Thinking-2507_k12_t0.7_maxtok12288Apache-2.0代码推理143

行数统计:

  • 标准化近期推理池:8,680 行。
  • 选定的冗长推理集:6,144 行。
  • 紧凑原始转换输出:6,144 行。
  • 清理后的打包 SFT 分片:4,517 训练 / 245 验证 / 247 测试。
  • 经过长度过滤后接受的 Qwen 训练行:4,385。
  • 被长度过滤跳过的 Qwen 训练行:132。
  • 训练期间使用的评估行:64。

紧凑推理转换由 cyankiwi/Qwen3.6-35B-A3B-AWQ-4bit 通过 vLLM 服务生成。在训练前,对行的压缩比、答案保留、格式错误标签、重复、固定推理标签、语气问题以及关键信息明显丢失等情况进行了检查。

https://huggingface.co/kai-os/Grug-35B-A3B#training-procedure 训练过程

训练是纯完成式的 SFT:提示令牌被 -100 屏蔽,仅训练助手的完成部分。

核心设置:

  • 基础模型:Qwen/Qwen3.6-35B-A3B
  • 方法:QLoRA / PEFT LoRA,训练后合并到完整的模型权重中上传。
  • 训练期间量化:4 位 NF4,BF16 计算。
  • 硬件:8x NVIDIA Tesla V100-SXM2 16GB。
  • 最大序列长度:1,792。
  • LoRA 秩:4。
  • LoRA alpha:8。
  • 批次大小:1。
  • 梯度累积:4。
  • 学习率:8e-5。
  • 最大步数:100。
  • 评估步长:25。
  • 保存步长:25。
  • 训练运行时间:约 1 小时 41 分钟 44 秒。
  • 每秒训练样本数:0.066。
  • 每秒训练步数:0.016。
  • 训练损失:1.051。

验证损失:

步数评估损失
251.1510
501.0793
751.0487
1001.0399

https://huggingface.co/kai-os/Grug-35B-A3B#local-smoke-test 本地烟雾测试

最终检查点的烟雾测试输出紧凑,并且没有使用固定的 目标/规则/逻辑/边界 标签。

示例:

衬衫 80 美元,25% 折扣。80 的 25% = 20。80 - 20 = 60。检查:60/80 = 0.75。正确。答案 60。售价为 60 美元。

Bug 修复烟雾测试正确地将 len(x) 识别为问题并将其更改为 len(xs)

这只是一个烟雾测试,并非全面的基准测试。在将模型用于敏感或生产环境之前,请自行运行评估。

https://huggingface.co/kai-os/Grug-35B-A3B#usage 使用方法

import torch
from transformers import AutoModelForCausalLM, AutoTokenizer

model_id = "kai-os/Grug-35B-A3B"
tokenizer = AutoTokenizer.from_pretrained(model_id, trust_remote_code=True)
model = AutoModelForCausalLM.from_pretrained(
    model_id,
    torch_dtype=torch.bfloat16,
    device_map="auto",
    trust_remote_code=True,
)
model.eval()

messages = [
    {"role": "user", "content": "If a shirt is $80 and goes 25% off, what is the sale price?"}
]

inputs = tokenizer.apply_chat_template(
    messages,
    return_tensors="pt",
    add_generation_prompt=True,
).to(model.device)

with torch.no_grad():
    output = model.generate(inputs, do_sample=False, max_new_tokens=512)
print(tokenizer.decode(output[0], skip_special_tokens=True))

对于令牌效率测试,请使用相同的提示和解码设置与基础模型进行比较。除非部署本身需要,否则不要为基准测试声明使用人为的生成上限。

https://huggingface.co/kai-os/Grug-35B-A3B#limitations 局限

  • 这是一个实验性的紧凑推理微调版本。
  • 训练运行规模本就较小,应视为首个 Qwen/A3B 检查点,而非经过全面基准测试的生产模型。
  • 在处理需要更长推导过程的任务时,它可能过度压缩推理。
  • 它继承了基础模型的局限性和安全行为。
  • 报告的评估是本地的且有限的。
  • 数据集包含来自所列开源数据集的合成和蒸馏推理轨迹;在商业或敏感环境中使用前,请审核来源许可证和出处。

https://huggingface.co/kai-os/Grug-35B-A3B#acknowledgements 致谢

感谢 Lambda (https://lambda.com/) 推理提供商提供计算积分,以支持数据集工作、训练和评估。

kaios (@kaiostephens): 隆重介绍 ⭐Grug-12b!⭐

Grug 是一个基于 Gemma-4-12b 构建的开源实验性模型,旨在通过将思考过程精简为仅必要的部分,来复制 GPT-5.5 的效率。

Grug 平均减少约 69.8% 的推理令牌输出,同时性能保持在…

相似文章

Qwen3.6-27B-GGUF 重磅发布!

Reddit r/LocalLLaMA

社区 GGUF 版本上线,Qwen 27B 混合架构模型支持 262K 上下文、多模态输入、工具调用,并保留“思考过程”,专为智能体编程而生。

Qwen/Qwen3.6-35B-A3B-FP8

Hugging Face Models Trending

阿里巴巴发布了Qwen3.6-35B-A3B-FP8,这是Qwen3.6的开源权重量化变体,拥有35B参数,通过MoE激活3B,具有改进的智能编码能力和保持思维链的迭代开发特性。