Jackrong/Qwopus3.6-27B-v2-MTP-GGUF
摘要
Jackrong/Qwopus3.6-27B-v2-MTP-GGUF 是 27B 参数语言模型的 GGUF 量化版本,托管在 Hugging Face 上,并附有使用各种库和工具的说明。
查看缓存全文
缓存时间: 2026/05/24 13:52
Jackrong/Qwopus3.6-27B-v2-MTP-GGUF · Hugging Face 来源: https://huggingface.co/Jackrong/Qwopus3.6-27B-v2-MTP-GGUF
使用 Jackrong/Qwopus3.6-27B-v2-MTP-GGUF 的说明(配合各类库、推理服务商、笔记本和本地应用)。点击以下链接即可开始。
-
库
-
Transformers (https://huggingface.co/Jackrong/Qwopus3.6-27B-v2-MTP-GGUF?library=transformers)
如何使用 Transformers 调用 Jackrong/Qwopus3.6-27B-v2-MTP-GGUF:# 使用 pipeline 作为高级辅助 from transformers import pipeline pipe = pipeline("text-generation", model="Jackrong/Qwopus3.6-27B-v2-MTP-GGUF") messages = [ {"role": "user", "content": "你是谁?"}, ] pipe(messages)# 直接从 Transformers 加载模型 from transformers import AutoModel model = AutoModel.from_pretrained("Jackrong/Qwopus3.6-27B-v2-MTP-GGUF", dtype="auto") -
llama-cpp-python (https://huggingface.co/Jackrong/Qwopus3.6-27B-v2-MTP-GGUF?library=llama-cpp-python)
如何使用 llama-cpp-python 调用 Jackrong/Qwopus3.6-27B-v2-MTP-GGUF:# !pip install llama-cpp-python from llama_cpp import Llama llm = Llama.from_pretrained( repo_id="Jackrong/Qwopus3.6-27B-v2-MTP-GGUF", filename="Qwopus3.6-27B-v2-MTP-BF16.gguf", )llm.create_chat_completion( messages = [ { "role": "user", "content": "法国的首都是什么?" } ] )
-
-
笔记本
- Google Colab (https://huggingface.co/Jackrong/Qwopus3.6-27B-v2-MTP-GGUF/colab)
- Kaggle (https://huggingface.co/Jackrong/Qwopus3.6-27B-v2-MTP-GGUF/kaggle)
-
本地应用 (https://huggingface.co/settings/local-apps#local-apps)
-
llama.cpp (https://huggingface.co/Jackrong/Qwopus3.6-27B-v2-MTP-GGUF?local-app=llama.cpp)
如何使用 llama.cpp 调用 Jackrong/Qwopus3.6-27B-v2-MTP-GGUF:通过 brew 安装
brew install llama.cpp # 启动本地兼容 OpenAI 的服务器,带有 Web 界面: llama-server -hf Jackrong/Qwopus3.6-27B-v2-MTP-GGUF:Q4_K_M # 直接在终端中执行推理: llama-cli -hf Jackrong/Qwopus3.6-27B-v2-MTP-GGUF:Q4_K_M通过 WinGet(Windows)安装
winget install llama.cpp # 启动本地兼容 OpenAI 的服务器,带有 Web 界面: llama-server -hf Jackrong/Qwopus3.6-27B-v2-MTP-GGUF:Q4_K_M # 直接在终端中执行推理: llama-cli -hf Jackrong/Qwopus3.6-27B-v2-MTP-GGUF:Q4_K_M使用预编译二进制
# 从以下地址下载预编译二进制: # https://github.com/ggerganov/llama.cpp/releases # 启动本地兼容 OpenAI 的服务器,带有 Web 界面: ./llama-server -hf Jackrong/Qwopus3.6-27B-v2-MTP-GGUF:Q4_K_M # 直接在终端中执行推理: ./llama-cli -hf Jackrong/Qwopus3.6-27B-v2-MTP-GGUF:Q4_K_M从源码构建
git clone https://github.com/ggerganov/llama.cpp.git cd llama.cpp cmake -B build cmake --build build -j --target llama-server llama-cli # 启动本地兼容 OpenAI 的服务器,带有 Web 界面: ./build/bin/llama-server -hf Jackrong/Qwopus3.6-27B-v2-MTP-GGUF:Q4_K_M # 直接在终端中执行推理: ./build/bin/llama-cli -hf Jackrong/Qwopus3.6-27B-v2-MTP-GGUF:Q4_K_M使用 Docker
docker model run hf.co/Jackrong/Qwopus3.6-27B-v2-MTP-GGUF:Q4_K_M -
vLLM (https://huggingface.co/Jackrong/Qwopus3.6-27B-v2-MTP-GGUF?local-app=vllm)
如何使用 vLLM 调用 Jackrong/Qwopus3.6-27B-v2-MTP-GGUF:通过 pip 安装并提供模型服务
# 通过 pip 安装 vLLM: pip install vllm # 启动 vLLM 服务器: vllm serve "Jackrong/Qwopus3.6-27B-v2-MTP-GGUF" # 使用 curl 调用服务器(兼容 OpenAI 的 API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "Jackrong/Qwopus3.6-27B-v2-MTP-GGUF", "messages": [ { "role": "user", "content": "法国的首都是什么?" } ] }'使用 Docker
docker model run hf.co/Jackrong/Qwopus3.6-27B-v2-MTP-GGUF:Q4_K_M -
SGLang (https://huggingface.co/Jackrong/Qwopus3.6-27B-v2-MTP-GGUF?local-app=sglang)
如何使用 SGLang 调用 Jackrong/Qwopus3.6-27B-v2-MTP-GGUF:通过 pip 安装并提供模型服务
# 通过 pip 安装 SGLang: pip install sglang # 启动 SGLang 服务器: python3 -m sglang.launch_server \ --model-path "Jackrong/Qwopus3.6-27B-v2-MTP-GGUF" \ --host 0.0.0.0 \ --port 30000 # 使用 curl 调用服务器(兼容 OpenAI 的 API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "Jackrong/Qwopus3.6-27B-v2-MTP-GGUF", "messages": [ { "role": "user", "content": "法国的首都是什么?" } ] }'使用 Docker 镜像
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "Jackrong/Qwopus3.6-27B-v2-MTP-GGUF" \ --host 0.0.0.0 \ --port 30000 # 使用 curl 调用服务器(兼容 OpenAI 的 API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "Jackrong/Qwopus3.6-27B-v2-MTP-GGUF", "messages": [ { "role": "user", "content": "法国的首都是什么?" } ] }' -
Ollama (https://huggingface.co/Jackrong/Qwopus3.6-27B-v2-MTP-GGUF?local-app=ollama)
如何使用 Ollama 调用 Jackrong/Qwopus3.6-27B-v2-MTP-GGUF:ollama run hf.co/Jackrong/Qwopus3.6-27B-v2-MTP-GGUF:Q4_K_M -
Unsloth Studio new (https://huggingface.co/Jackrong/Qwopus3.6-27B-v2-MTP-GGUF?local-app=unsloth)
如何使用 Unsloth Studio 调用 Jackrong/Qwopus3.6-27B-v2-MTP-GGUF:安装 Unsloth Studio(macOS、Linux、WSL)
curl -fsSL https://unsloth.ai/install.sh | sh # 运行 unsloth studio unsloth studio -H 0.0.0.0 -p 8888 # 然后在浏览器中打开 http://localhost:8888 # 搜索 Jackrong/Qwopus3.6-27B-v2-MTP-GGUF 即可开始对话安装 Unsloth Studio(Windows)
irm https://unsloth.ai/install.ps1 | iex # 运行 unsloth studio unsloth studio -H 0.0.0.0 -p 8888 # 然后在浏览器中打开 http://localhost:8888 # 搜索 Jackrong/Qwopus3.6-27B-v2-MTP-GGUF 即可开始对话使用 HuggingFace Spaces 运行 Unsloth
# 无需额外设置 # 在浏览器中打开 https://huggingface.co/spaces/unsloth/studio # 搜索 Jackrong/Qwopus3.6-27B-v2-MTP-GGUF 即可开始对话 -
Pinew (https://huggingface.co/Jackrong/Qwopus3.6-27B-v2-MTP-GGUF?local-app=pi)
如何使用 Pi 调用 Jackrong/Qwopus3.6-27B-v2-MTP-GGUF:启动 llama.cpp 服务器
# 安装 llama.cpp: brew install llama.cpp # 启动本地兼容 OpenAI 的服务器: llama-server -hf Jackrong/Qwopus3.6-27B-v2-MTP-GGUF:Q4_K_M在 Pi 中配置模型
# 安装 Pi: npm install -g @mariozechner/pi-coding-agent # 添加到 ~/.pi/agent/models.json: { "providers": { "llama-cpp": { "baseUrl": "http://localhost:8080/v1", "api": "openai-completions", "apiKey": "none", "models": [ { "id": "Jackrong/Qwopus3.6-27B-v2-MTP-GGUF:Q4_K_M" } ] } } }运行 Pi
# 在项目目录中启动 Pi: pi -
Hermes Agent new (https://huggingface.co/Jackrong/Qwopus3.6-27B-v2-MTP-GGUF?local-app=hermes-agent)
如何使用 Hermes Agent 调用 Jackrong/Qwopus3.6-27B-v2-MTP-GGUF:启动 llama.cpp 服务器
# 安装 llama.cpp: brew install llama.cpp # 启动本地兼容 OpenAI 的服务器: llama-server -hf Jackrong/Qwopus3.6-27B-v2-MTP-GGUF:Q4_K_M配置 Hermes
# 安装 Hermes: curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash hermes setup # 将 Hermes 指向本地服务器: hermes config set model.provider custom hermes config set model.base_url http://127.0.0.1:8080/v1 hermes config set model.default Jackrong/Qwopus3.6-27B-v2-MTP-GGUF:Q4_K_M运行 Hermes
hermes -
Docker Model Runner (https://huggingface.co/Jackrong/Qwopus3.6-27B-v2-MTP-GGUF?local-app=docker-model-runner)
如何使用 Docker Model Runner 调用 Jackrong/Qwopus3.6-27B-v2-MTP-GGUF:docker model run hf.co/Jackrong/Qwopus3.6-27B-v2-MTP-GGUF:Q4_K_M -
Lemonade (https://huggingface.co/Jackrong/Qwopus3.6-27B-v2-MTP-GGUF?local-app=lemonade)
如何使用 Lemonade 调用 Jackrong/Qwopus3.6-27B-v2-MTP-GGUF:拉取模型
# 从 https://lemonade-server.ai/ 下载 Lemonade lemonade pull Jackrong/Qwopus3.6-27B-v2-MTP-GGUF:Q4_K_M运行并与模型对话
lemonade run user.Qwopus3.6-27B-v2-MTP-GGUF-Q4_K_M列出所有可用模型
lemonade list
-
🪐 Qwopus3.6-27B-v2-MTP
MTP 发布 —— 基于 Qwen3.6-27B 微调的多 Token 预测推理模型
🧬 迹反转与负熵
🧠 27B 参数
⚡ 推测解码
🛠️ 编码 / DevOps / 数学
💡 什么是 Qwopus3.6-27B-v2-MTP?
🪐 Qwopus3.6-27B-v2-MTP 是一个面向速度的推理发布版本,构建在 Qwen3.6-27B 之上。它延续了 Qwopus 系列在重构推理轨迹、编码规范、DevOps 流程和数学推导方面的专注,同时新增了多 Token 预测以实现更快的生成。目标很简单:保留 27B 推理模型的深度与结构,同时让实际交互使用明显更快。
⚡ MTP 解码
辅助的未来 Token 预测可提高长推理、代码、数学和严格格式提示的吞吐量。
🧩 结构化推理
继承了围绕逐步推理轨迹重构构建的 Qwopus 训练配方。
🧪 GB10 测试
在包含逻辑、编码、DevOps、数学和边缘任务的 30 题本地基准上得到验证。
🚀 实际速度
专为需要强答案但又不希望每个任务多等几分钟的工作流程而设计。
💡 1. 基础模型、训练库与协作
🧠 1.1 基础模型规格(Qwen3.6-27B)
Qwen3.6-27B 为该发布版本提供了稠密的 27B 基础。Qwopus3.6-27B-v2-MTP 专注于保留基础模型的广泛推理能力,同时将输出风格调整为逐步分析、工具感知执行和实用工程答案。
| 属性 | 规格与详情 |
|---|---|
| 🧠 架构 | 稠密 Transformer / 27B 参数 |
| 🎯 重点领域 | 智能体编码、DevOps、结构化逻辑、数学、严格格式输出 |
| ⚡ MTP 目标 | 通过多 Token 推测预测提高生成吞吐量,同时保持最终答案质量 |
🧪 1.2 硬件协作与联合开发
本项目与硬件工程师 Kyle Hessling 紧密合作完成,其基础设施和训练支持使稳定的 27B 规模实验成为可能。
👉 您可以在 X / Twitter 上关注他了解硬件和模型训练动态:@KyleHessling1 (https://x.com/KyleHessling1)
🦥 1.3 微调框架(Unsloth)
模型训练工作流由 Unsloth 加速并优化内存使用。特别感谢 Unsloth 团队让高效的大模型微调变得更加可及。
⚙️ 1.4 自定义 MTP 头处理与自动化工具
本发布版采用针对 Qwen 系列多 Token 预测(MTP)头设计的自定义拆分与合并方法。自动化技能和完整的处理流程脚本已在 qwen-mtp-gguf (https://github.com/R6410418/Jackrong-llm-finetuning-guide/tree/main/qwen-mtp-gguf) 开源。
🌟 如果您觉得该工具包有用,请在 GitHub 上为项目点个星支持一下!
社区发布声明:Qwopus3.6-27B-v2-MTP 是面向研究、评估和工作流探索的实验性社区发布版本。
🚀 2. MTP 基准测试:Qwen3.6-27B vs Qwopus3.6-27B-v2-MTP
在涵盖逻辑、编码、DevOps、数学和边缘格式任务的 30 题基准测试中,Qwopus3.6-27B-v2-MTP 相比 Qwen3.6-27B 展现了明显的速度优势,同时生成了更紧凑的整体答案流。该基准测试不仅仅是原始吞吐量测试:它包括长编码提示、操作手册、数学推导和严格的约束输出案例。
-
总体吞吐量:10.46 T/s,是 Qwen3.6-27B 的 1.66 倍
-
节省延迟:2.34 小时,总时间减少 56.5%
-
Token 效率:整体完成 Token 减少 27.7%
-
覆盖范围:30/30,所有基准提示均已完成
-
速度:Qwopus3.6-27B-v2-MTP 达到总体 10.46 tokens/秒,而 Qwen3.6-27B 为 6.29 tokens/秒。
-
延迟:总评估时间从 14,901.69 秒 降至 6,487.81 秒,整个运行过程节省了 8,413.88 秒。
-
输出形态:MTP 生成了 67,862 个完成 Token,而 Qwen3.6-27B 为 93,802 个,整体响应轮廓更紧凑。
基准测试来源:GB10 服务器上的
/workspace/renji-training/Jackrong/qwopus3.6-27B-v2-MTP/benchmark_27b_pair_report.md。本地工作区日期:2026-05-22。
⚙️ 3. 测试环境与配置
- 计算平台:GB10 专用服务器平台。
- 评估格式:两个模型使用相同的本地 GGUF 服务器栈。
- llama-server 总上下文:
49152。 - Temperature / Top-p:
1.0 / 0.95。 - 最大生成 Token:无明确上限;生成受请求预算约束。
- 请求格式:
/v1/chat/completions,用户内容为文本负载。
基准测试汇总:Qwen3.6-27B vs Qwopus3.6-27B-v2-MTP
| 模型 | 完成 | 平均速度 | 总体 T/s | 完成 Token | 总时间 |
|---|---|---|---|---|---|
| Qwen3.6-27B | 30 | 6.32 | 6.29 | 93,802 | 14,901.69s |
| Qwopus3.6-27B-v2-MTP | 30 | 10.66 | 10.46 | 67,862 | 6,487.81s |
领域级性能
| 领域 | 问题数 | Qwen3.6-27B T/s | MTP T/s | 延迟增益 | Qwen3.6-27B 时间 | MTP 时间 | Token 差异 |
|---|---|---|---|---|---|---|---|
| 逻辑 | 5 | 6.33 | 10.77 | 2.31x | 38.5 min | 16.7 min | -26.3% |
| 编码 | 7 | 6.26 | 10.27 | 2.25x | 1.52 h | 40.6 min | -27.3% |
| DevOps | 6 | 6.29 | 10.39 | 2.31x | 47.4 min | 20.5 min | -28.5% |
| 数学 | 8 | 6.29 | 11.00 | 2.35x | 1.01 h | 25.8 min | -25.6% |
| 边缘 | 4 | 6.48 | 8.28 | 2.27x | 10.3 min | 4.5 min | -43.6% |
📊 4. 完整 30 题对比
下表使基准测试具体化:每一行都在相同提示下比较基础 Qwen3.6-27B 运行与 Qwopus MTP 运行。最显著的改进出现在严格输出、概率、DevOps 配置和中长编码任务上,而少数提示有意生成了更详细的 MTP 答案。
30 题详细对比
| 问题 | 领域 | 任务 | Qwen T/s | Qwen 时间 | Qwen Token | MTP T/s | MTP 时间 | MTP Token | 结果模式 |
|---|---|---|---|---|---|---|---|---|---|
| Q1 | 逻辑 | 错误标记的硬币盒 | 6.36 | 9.4 min | 3,569 | 11.40 | 2.3 min | 1,530 | 4.16x 更快;更简洁 |
| Q2 | 逻辑 | 工程师部署排序 | 6.39 | 6.1 min | 2,349 | 10.98 | 3.1 min | 2,034 | 1.98x 更快;更简洁 |
| Q3 | 逻辑 | 自指真值卡 | 6.37 | 7.8 min | 2,990 | 10.83 | 4.5 min | 2,942 | 1.72x 更快;长度相近 |
| Q4 | 逻辑 | 三个开关和灯泡 | 6.32 | 3.6 min | 1,342 | 10.44 | 1.6 min | 999 | 2.21x 更快;更简洁 |
| Q5 | 逻辑 | HH vs TH 停止概率 | 6.30 | 11.6 min | 4,367 | 10.62 | 5.2 min | 3,266 | 2.25x 更快;更简洁 |
| Q6 | 编码 | 流式 top-k 频率 | 6.28 | 13.8 min | 5,210 | 9.95 | 13.3 min | 7,917 | 1.04x 更快;更丰富 |
| Q7 | 编码 | 线程安全 TTL 缓存 | 6.28 | 18.6 min | 7,009 | 10.64 | 5.3 min | 3,367 | 3.52x 更快;更简洁 |
| Q8 | 编码 | 区间合并实现 | 6.25 | 11.2 min | 4,203 | 10.83 | 3.3 min | 2,157 | 3.36x 更快;更简洁 |
| Q9 | 编码 | 流式 CSV 转 JSONL | 6.26 | 16.5 min | 6,200 | 10.62 | 5.9 min | 3,741 | 2.81x 更快;更简洁 |
| Q10 | 编码 | C++17 LRU 缓存 | 6.27 | 13.1 min | 4,920 | 10.15 | 6.0 min | 3,644 | 2.18x 更快;更简洁 |
| Q11 | 编码 | 最高薪资员工 SQL | 6.29 | 6.1 min | 2,283 | 10.37 | 2.4 min | 1,475 | 2.54x 更快;更简洁 |
| Q12 | 编码 | 原子 Bash 备份 | 6.28 | 12.1 min | 4,545 | 10.33 | 4.4 min | 2,695 | 2.76x 更快;更简洁 |
| Q13 | DevOps | Nginx 反向代理 | 6.29 | 10.4 min | 3,924 | 10.88 | 2.8 min | 1,821 | 3.70x 更快;更简洁 |
相似文章
Jackrong/Qwopus3.6-27B-Coder-MTP-GGUF
GGUF量化版本的Qwopus3.6-27B-Coder-MTP模型已发布在Hugging Face上,针对本地推理进行了优化,兼容Transformers、vLLM、SGLang和Unsloth Studio。
Jackrong/Qwopus3.6-27B-Coder-Compat-MTP-GGUF
Jackrong 发布了 Qwopus3.6-27B-Coder-Compat-MTP-GGUF,这是 Qwopus3.6-27B-Coder 模型的 GGUF 量化版本,并扩展了聊天模板,以提升与工具使用运行时及 OpenAI 兼容的代理框架的互操作性。
Jackrong/Qwopus3.6-27B-v2-GGUF
Qwopus3.6-27B-v2是Qwen3.6-27B的推理增强微调版本,使用Trace Inversion数据集和课程学习,以GGUF格式发布以实现高效推理。
Jackrong/Qwopus3.6-35B-A3B-v1-GGUF
Jackrong 发布 Qwopus3.6-35B-A3B-v1,基于阿里巴巴 Qwen3.6 MoE 模型的推理增强微调版本,针对逻辑推理和智能体编程优化,拥有 350 亿总参数和 30 亿激活参数。
Jackrong/Qwopus3.5-9B-Coder-MTP-GGUF
Jackrong 发布了 Qwopus3.5-9B-Coder-MTP-GGUF,这是一个基于 Qwen 的 9B 代码模型,采用多令牌预测 (MTP) 架构进行微调,相较于基模型实现了 35.8% 的吞吐量提升和 8.3% 的准确率提升,在代码和数学基准测试中取得满分。