@BottleCapAI:相同模型大小,相同GPU,完成约4.7倍工作!ThinkingCap:Qwen 3.8 用大约一半的推理达到答案。O…

X AI KOLs Timeline 模型

摘要

ThinkingCap 是基于 Qwen 3.6 27B 的微调模型,它将推理标记减少了约50%,同时保持性能,从而在推理中带来显著的效率提升。

相同模型大小。相同GPU。完成约4.7倍工作!ThinkingCap:Qwen 3.8 用大约一半的推理达到答案。在共享服务器上,这意味着内存中可以同时容纳2倍多的用户,每个用户完成速度快2倍。单独运行?答案速度快约2倍。为团队服务?吞吐量约4.7倍。Hugging Face: https://huggingface.co/bottlecapai/ThinkingCap-Qwen3.6-27B…
查看原文
查看缓存全文

缓存时间: 2026/09/26 06:54

相同模型规模,相同GPU,完成的工作量却提升约4.7倍!ThinkingCap:Qwen 3.8仅需约一半的推理量即可得出答案。在共享服务器上,这意味着内存中可同时容纳2倍用户,且每位用户的处理速度也提升2倍。若单独运行?答案生成速度提升约2倍。若为团队提供服务?吞吐量提升约4.7倍。
Hugging Face 链接:https://huggingface.co/bottlecapai/ThinkingCap-Qwen3.6-27B


bottlecapai/ThinkingCap-Qwen3.6-27B · Hugging Face

来源:https://huggingface.co/bottlecapai/ThinkingCap-Qwen3.6-27B

ThinkingCap — BottleCap AI(https://www.bottlecapai.com/)

https://huggingface.co/bottlecapai/ThinkingCap-Qwen3.6-27B#thinkingcap-qwen-36-27b

ThinkingCap:Qwen 3.6 27B
在保留 Qwen3.6-27B(Qwen 团队,2026)(https://huggingface.co/Qwen/Qwen3.6-27B)完整能力的前提下,通过微调实现平均推理 token 减少 50%,最佳情况下可减少超过 90%。微调采用前沿算法,基于涵盖多领域、多难度的精选问题集进行。我们设计的微调过程尽可能保持最小干预,在确保 token 效率提升的同时,完全保留 Qwen 原始的答案质量与风格。详情请参阅博客文章(https://www.bottlecapai.com/thinkingcap-qwen3-6-27b)。

我们对最终模型进行了严格评估,覆盖通用推理、非推理型多选问答、日常多轮对话、系统提示遵循、安全性、数学、代码及智能体使用场景。由于 Qwen 推荐的采样温度 1.0 下推理质量存在高方差,我们为每个基准测试运行多个随机种子,并对所有结果进行统计显著性检验。评估包括领域内(训练集中包含所选数据集的保留部分)与领域外测试。

ThinkingCap 推理演示(6倍速度)

https://huggingface.co/bottlecapai/ThinkingCap-Qwen3.6-27B#out-of-domain-token-efficiency

领域外 Token 效率

基准测试准确率(基础 / 我们)推理 Token(基础 / 我们)减少比例
知识与推理
GPQA-Diamond85.5±1.4 / 83.8±1.910,777 / 3,351↓ 67.8%
SuperGPQA64.0±0.2 / 64.0±0.18,246 / 3,384↓ 58.4%
MMLU-Pro85.9±0.2 / 85.4±0.23,455 / 1,290↓ 53.7%
MMLU-Redux93.9±0.1 / 93.9±0.1947 / 406↓ 44.8%
C-Eval90.6±0.7 / 90.3±0.61,279 / 663↓ 47.1%
数学与代码
HMMT (2025年11月)88.0±3.7 / 84.7±3.739,277 / 27,388↓ 38.0%
LiveCodeBench80.7±0.6 / 84.3±1.015,744 / 10,158↓ 41.1%
长上下文与多模态
LongBench v262.6±3.6 / 60.2±1.71,765 / 1,091↓ 39.1%
RealWorldQA82.4±0.7 / 81.9±1.22,959 / 913↓ 48.5%
AA-LCR76.2±3.0 / 74.2±2.22,455 / 1,337↓ 45.5%
指令遵循与智能体
系统提示遵循80.6±1.2 / 81.5±1.81,737 / 976↓ 40.0%
Claw-Eval(思考/任务)87.0±1.9 / 84.4±1.2919 / 689↓ 25.2%
宏观平均81.5 / 80.7—↓ 45.8%

*Claw-Eval 推理 Token 为每任务统计(智能体场景;非单轮推理链)。

设置

  • 模型: 基础模型 Qwen/Qwen3.6-27B 对比 bottlecapai/ThinkingCap-Qwen3.6-27B(表中显示为“我们”)。
  • 随机种子: 每条件5个种子;启用推理模式;单元格数据为跨种子的均值 ± 95% 置信区间。
  • 解码参数: 启用推理模式;采样 temperature=1.0, top_p=0.95, top_k=20, min_p=0.0(bottlecapai/ThinkingCap-Qwen3.6-27B 使用基础模型的采样参数)。
  • 最大生成 Token 数: 通用测试套件(gpqa_diamond、mmlu_pro、longbench_v2、realworldqa)及 AA-LCR 为 100,000;HMMT(2025年11月)为 250,000;supergpqa 和 livecodebench 为 32,768;ceval 和 mmlu_redux 为 16,384;llm-system-prompts-benchmark 为 15,000;Claw-Eval 为 49,152。
  • 指标——列含义与表格一致:
    • 准确率(基础 / 我们)——正确比例(精确/正则匹配;llm-system-prompts-benchmark 采用软合规;Claw-Eval 由评判器评分任务分数;AA-LCR 由评判器判定正确/错误)。
    • 推理 Token(基础 / 我们)——单轮推理链的平均长度(Claw-Eval 为每任务思考 Token)。
    • 减少比例——每问题平均推理 Token 节省量:基础与“我们”在相同问题上配对(每边取种子平均),计算每个问题的 (基础 − cap) / 基础,然后对共享问题取平均(↓ 值越大表示节省越多)。
    • 宏观平均(底部行)——各基准测试等权重均值。

我们单独跟踪两种推理链质量故障模式,仅汇总报告:循环——模型陷入重复相同推理链(有时为单句)而无法结束思考;通过重复 n-gram 比例检测;截断——推理链未闭合,因模型在推理过程中达到生成 Token 上限,导致无法产出答案。在所有领域外响应中,截断率从 2.9% 降至 0.4%,而循环率保持可忽略(~0.2%)。

https://huggingface.co/bottlecapai/ThinkingCap-Qwen3.6-27B#in-domain-evals

领域内评估
训练集中包含其训练部分的数据集的测试集保留数据——用于评估分布内任务的质量保留情况(对比上述领域外基准测试)。

基准测试准确率(基础 / 我们)推理 Token(基础 / 我们)减少比例
GSM8K93.3±1.5 / 96.5±0.33,175 / 648↓ 74.1%
ARC-Challenge97.0±0.3 / 97.6±0.4966 / 335↓ 51.5%
ARC-Easy99.3±0.2 / 99.4±0.2566 / 260↓ 44.5%
CommonsenseQA86.7±0.7 / 88.2±0.91,118 / 273↓ 64.1%
OpenBookQA96.0±0.5 / 96.7±0.6858 / 248↓ 59.5%
QASC91.7±0.7 / 92.2±0.51,258 / 348↓ 61.9%
SciQ97.0±0.2 / 97.5±0.2766 / 276↓ 48.3%
宏观平均94.4 / 95.4—↓ 57.7%

设置

  • 随机种子: 每条件5个种子;启用推理模式;单元格数据为跨种子的均值 ± 95% 置信区间。
  • 解码参数: 采样 temperature=1.0, top_p=0.95, top_k=20, min_p=0.0(bottlecapai/ThinkingCap-Qwen3.6-27B 使用基础模型的采样参数)。
  • 最大生成 Token 数: GSM8K 为 15,000;多选题集为 8,192。
  • 数据: GSM8K 为完整测试集(1,319 行);多选题集上限为 1,000 行(OpenBookQA = 500 和 QASC = 926 行数较少,故使用全集)。
  • 指标:
    • 准确率——最终答案精确匹配(GSM8K)/ 多选字母匹配(多选题)。
    • 推理 Token、减少比例及宏观平均定义同领域外 token 效率表格;循环与截断故障模式定义同上:在所有领域内响应中,截断率从 1.6% 降至 0.03%,循环率两者均极低(≤0.01%)。

https://huggingface.co/bottlecapai/ThinkingCap-Qwen3.6-27B#guardrails-preservation

安全防护保持
精简微调保留了安全行为:在两个安全测试集上,bottlecapai/ThinkingCap-Qwen3.6-27B 拒绝有害/越狱提示的比例与基础模型一致(统计无显著差异),同时使用更少的推理 Token。

基准测试SAFE %(基础 / 我们)推理 Token(基础 / 我们)减少比例
Nemotron-Safety98.9±0.8 / 99.0±0.41,242 / 933↓ 23.8%
HEx-PHI99.9±0.2 / 100.0±0.0693 / 543↓ 20.0%
宏观平均99.4 / 99.5—↓ 21.9%

设置

  • 随机种子: 每条件5个种子;启用推理模式;单元格数据为跨种子的均值 ± 95% 置信区间。
  • 基准测试:
    • Nemotron-Safety——取自 nvidia/Llama-Nemotron-Post-Training-Dataset 的 safety 子集的 300 条提示样本。
    • HEx-PHI——300 条 HEx-PHI 有害指令(jkazdan/guardrail-llama-3-8b-refusal-hexphi)。两者均为安全相关/越狱提示。两个数据集仅包含训练子集,鉴于其近乎完美的得分,难以排除 Qwen 原始训练数据中可能存在的污染。这些结果仅作为防护能力保持的展示,与我们的内部使用测试一致。
  • 指标:
    • SAFE %——LLM 安全评判器标记为 SAFE(维持防护——拒绝或安全规避有害请求)的回复比例;越高越好。
    • 推理 Token及减少比例定义同领域外 token 效率表格。

https://huggingface.co/bottlecapai/ThinkingCap-Qwen3.6-27B#usage

使用方法

https://huggingface.co/bottlecapai/ThinkingCap-Qwen3.6-27B#hosted-api-requesty

托管 API(Requesty)
不想自己运行权重?ThinkingCap-Qwen3.6-27B 可通过 API 在 Requesty 上托管服务(https://www.requesty.ai/models/sference/thinkingcap-qwen3.6-27b)——直接调用,无需本地 GPU。

https://huggingface.co/bottlecapai/ThinkingCap-Qwen3.6-27B#huggingface-transformers

HuggingFace Transformers

from transformers import AutoModelForImageTextToText, AutoProcessor

model = AutoModelForImageTextToText.from_pretrained(
    "bottlecapai/ThinkingCap-Qwen3.6-27B", dtype="bfloat16"
)
proc = AutoProcessor.from_pretrained("bottlecapai/ThinkingCap-Qwen3.6-27B")

请参考 https://huggingface.co/Qwen/Qwen3.6-27B 获取推荐用法、采样参数等。

https://huggingface.co/bottlecapai/ThinkingCap-Qwen3.6-27B#vllm–sglang

vLLM / SGLang
使用任一引擎提供 bf16 模型服务——标准模式,或使用模型自身的 MTP(多 token 预测 / NextN)头进行自推测解码(无需单独的草稿模型):

# vLLM — 标准模式
vllm serve bottlecapai/ThinkingCap-Qwen3.6-27B

# vLLM — 启用 MTP 自推测解码(vLLM ≥ 0.24.0)
vllm serve bottlecapai/ThinkingCap-Qwen3.6-27B \
  --speculative-config '{"method":"mtp","num_speculative_tokens":3}'

# SGLang — 标准模式
python -m sglang.launch_server \
  --model-path bottlecapai/ThinkingCap-Qwen3.6-27B \
  --trust-remote-code

# SGLang — 启用 MTP 自推测解码
python -m sglang.launch_server \
  --model-path bottlecapai/ThinkingCap-Qwen3.6-27B \
  --trust-remote-code \
  --speculative-algorithm EAGLE \
  --speculative-num-steps 3 \
  --speculative-eagle-topk 1 \
  --speculative-num-draft-tokens 4

MTP 推测解码无损——输出与标准解码一致——在 bf16 权重上,每个验证步骤可接受约 3.34 个草稿 token,在微调节省 token 的基础上进一步提升约 2.6 倍解码吞吐量。

若需在半内存下进行 GPU 服务,官方 FP8 构建版本位于 bottlecapai/ThinkingCap-Qwen3.6-27B-FP8(https://huggingface.co/bottlecapai/ThinkingCap-Qwen3.6-27B-FP8)——近乎无损,vLLM 原生加载(vllm serve bottlecapai/ThinkingCap-Qwen3.6-27B-FP8),MTP 头保持 bf16;完整服务基准见该模型卡。

https://huggingface.co/bottlecapai/ThinkingCap-Qwen3.6-27B#gguf-llamacpp

GGUF(llama.cpp)
该模型的量化 GGUF(https://github.com/ggml-org/ggml/blob/master/docs/gguf.md)构建版本位于姐妹仓库 bottlecapai/ThinkingCap-Qwen3.6-27B-GGUF(https://huggingface.co/bottlecapai/ThinkingCap-Qwen3.6-27B-GGUF),可与 llama.cpp(https://github.com/ggml-org/llama.cpp)及兼容运行时(Ollama、LM Studio 等)配合进行本地推理。

量化以降低精度存储权重——例如 Q4_K_M 约为每权重 4.7 位,而非 16 位 bf16——在质量轻微损失下大幅减少下载大小和内存占用。Q4_K_M 为推荐的质量/大小平衡,Q8_0 近乎无损。

llama-cli -hf bottlecapai/ThinkingCap-Qwen3.6-27B-GGUF:Q4_K_M -p "Hi"

https://huggingface.co/bottlecapai/ThinkingCap-Qwen3.6-27B#where-to-find-us

联系我们

https://huggingface.co/bottlecapai/ThinkingCap-Qwen3.6-27B#citation

引用
若使用此模型,请引用:

@misc{ThinkingCap-Qwen3.6-27B,
  title = {bottlecapai/ThinkingCap-Qwen3.6-27B},
  author = {Lasocki, Karol and Osusky, Adam and Lindauer, Jan and Jirkovsky, Adam and Mihal, Filip and Platek, Ondrej and Herel, David and Ihnatchenko, Luka and Bartek, Vojtech and Jirak, Jiri and Mikolov, Tomas},
  year = {2026},
}

https://huggingface.co/bottlecapai/ThinkingCap-Qwen3.6-27B#acknowledgements

致谢
我们感谢 EuroHPC 联合体授予项目 ID EHPC-AIF-2025SC03-029 使用意大利 CINECA 超算中心 Leonardo 的权限。

相似文章

bottlecapai/ThinkingCap-Qwen3.6-27B-GGUF

Hugging Face Models Trending

ThinkingCap-Qwen3.6-27B 是 Qwen3.6-27B 的精调版本,平均使用少 50% 的思考令牌,同时保持答案质量。此仓库提供 GGUF 量化格式,用于在 llama.cpp 上进行本地推理。