Jackrong/Qwopus3.6-27B-v2-MTP-GGUF

Hugging Face Models Trending 模型

摘要

Jackrong/Qwopus3.6-27B-v2-MTP-GGUF 是 27B 参数语言模型的 GGUF 量化版本,托管在 Hugging Face 上,并附有使用各种库和工具的说明。

任务:文本生成 标签:transformers, gguf, text-generation-inference, unsloth, qwen3_6, 推理, 思维链, mtp, 多令牌预测, 推测解码, lora, sft, agent, coder, devops, math, science, image, 文本生成, en, zh, ko, ru, ja, es, dataset:Jackrong/Claude-opus-4.7-TraceInversion-5000x, dataset:Jackrong/Claude-opus-4.6-TraceInversion-9000x, license:apache-2.0, 兼容端点, 区域:美国, 对话式
查看原文
查看缓存全文

缓存时间: 2026/05/24 13:52

Jackrong/Qwopus3.6-27B-v2-MTP-GGUF · Hugging Face 来源: https://huggingface.co/Jackrong/Qwopus3.6-27B-v2-MTP-GGUF

使用 Jackrong/Qwopus3.6-27B-v2-MTP-GGUF 的说明(配合各类库、推理服务商、笔记本和本地应用)。点击以下链接即可开始。

    • Transformers (https://huggingface.co/Jackrong/Qwopus3.6-27B-v2-MTP-GGUF?library=transformers)
      如何使用 Transformers 调用 Jackrong/Qwopus3.6-27B-v2-MTP-GGUF:

      # 使用 pipeline 作为高级辅助
      from transformers import pipeline
      pipe = pipeline("text-generation", model="Jackrong/Qwopus3.6-27B-v2-MTP-GGUF")
      messages = [
          {"role": "user", "content": "你是谁?"},
      ]
      pipe(messages)
      
      # 直接从 Transformers 加载模型
      from transformers import AutoModel
      model = AutoModel.from_pretrained("Jackrong/Qwopus3.6-27B-v2-MTP-GGUF", dtype="auto")
      
    • llama-cpp-python (https://huggingface.co/Jackrong/Qwopus3.6-27B-v2-MTP-GGUF?library=llama-cpp-python)
      如何使用 llama-cpp-python 调用 Jackrong/Qwopus3.6-27B-v2-MTP-GGUF:

      # !pip install llama-cpp-python
      from llama_cpp import Llama
      llm = Llama.from_pretrained(
          repo_id="Jackrong/Qwopus3.6-27B-v2-MTP-GGUF",
          filename="Qwopus3.6-27B-v2-MTP-BF16.gguf",
      )
      
      llm.create_chat_completion(
          messages = [
              { "role": "user", "content": "法国的首都是什么?" }
          ]
      )
      
  • 笔记本

    • Google Colab (https://huggingface.co/Jackrong/Qwopus3.6-27B-v2-MTP-GGUF/colab)
    • Kaggle (https://huggingface.co/Jackrong/Qwopus3.6-27B-v2-MTP-GGUF/kaggle)
  • 本地应用 (https://huggingface.co/settings/local-apps#local-apps)

    • llama.cpp (https://huggingface.co/Jackrong/Qwopus3.6-27B-v2-MTP-GGUF?local-app=llama.cpp)
      如何使用 llama.cpp 调用 Jackrong/Qwopus3.6-27B-v2-MTP-GGUF:

      通过 brew 安装
      brew install llama.cpp
      # 启动本地兼容 OpenAI 的服务器,带有 Web 界面:
      llama-server -hf Jackrong/Qwopus3.6-27B-v2-MTP-GGUF:Q4_K_M
      # 直接在终端中执行推理:
      llama-cli -hf Jackrong/Qwopus3.6-27B-v2-MTP-GGUF:Q4_K_M
      
      通过 WinGet(Windows)安装
      winget install llama.cpp
      # 启动本地兼容 OpenAI 的服务器,带有 Web 界面:
      llama-server -hf Jackrong/Qwopus3.6-27B-v2-MTP-GGUF:Q4_K_M
      # 直接在终端中执行推理:
      llama-cli -hf Jackrong/Qwopus3.6-27B-v2-MTP-GGUF:Q4_K_M
      
      使用预编译二进制
      # 从以下地址下载预编译二进制:
      # https://github.com/ggerganov/llama.cpp/releases
      # 启动本地兼容 OpenAI 的服务器,带有 Web 界面:
      ./llama-server -hf Jackrong/Qwopus3.6-27B-v2-MTP-GGUF:Q4_K_M
      # 直接在终端中执行推理:
      ./llama-cli -hf Jackrong/Qwopus3.6-27B-v2-MTP-GGUF:Q4_K_M
      
      从源码构建
      git clone https://github.com/ggerganov/llama.cpp.git
      cd llama.cpp
      cmake -B build
      cmake --build build -j --target llama-server llama-cli
      # 启动本地兼容 OpenAI 的服务器,带有 Web 界面:
      ./build/bin/llama-server -hf Jackrong/Qwopus3.6-27B-v2-MTP-GGUF:Q4_K_M
      # 直接在终端中执行推理:
      ./build/bin/llama-cli -hf Jackrong/Qwopus3.6-27B-v2-MTP-GGUF:Q4_K_M
      
      使用 Docker
      docker model run hf.co/Jackrong/Qwopus3.6-27B-v2-MTP-GGUF:Q4_K_M
      
    • LM Studio

    • Jan

    • vLLM (https://huggingface.co/Jackrong/Qwopus3.6-27B-v2-MTP-GGUF?local-app=vllm)
      如何使用 vLLM 调用 Jackrong/Qwopus3.6-27B-v2-MTP-GGUF:

      通过 pip 安装并提供模型服务
      # 通过 pip 安装 vLLM:
      pip install vllm
      # 启动 vLLM 服务器:
      vllm serve "Jackrong/Qwopus3.6-27B-v2-MTP-GGUF"
      # 使用 curl 调用服务器(兼容 OpenAI 的 API):
      curl -X POST "http://localhost:8000/v1/chat/completions" \
      -H "Content-Type: application/json" \
      --data '{
        "model": "Jackrong/Qwopus3.6-27B-v2-MTP-GGUF",
        "messages": [
          { "role": "user", "content": "法国的首都是什么?" }
        ]
      }'
      
      使用 Docker
      docker model run hf.co/Jackrong/Qwopus3.6-27B-v2-MTP-GGUF:Q4_K_M
      
    • SGLang (https://huggingface.co/Jackrong/Qwopus3.6-27B-v2-MTP-GGUF?local-app=sglang)
      如何使用 SGLang 调用 Jackrong/Qwopus3.6-27B-v2-MTP-GGUF:

      通过 pip 安装并提供模型服务
      # 通过 pip 安装 SGLang:
      pip install sglang
      # 启动 SGLang 服务器:
      python3 -m sglang.launch_server \
        --model-path "Jackrong/Qwopus3.6-27B-v2-MTP-GGUF" \
        --host 0.0.0.0 \
        --port 30000
      # 使用 curl 调用服务器(兼容 OpenAI 的 API):
      curl -X POST "http://localhost:30000/v1/chat/completions" \
      -H "Content-Type: application/json" \
      --data '{
        "model": "Jackrong/Qwopus3.6-27B-v2-MTP-GGUF",
        "messages": [
          { "role": "user", "content": "法国的首都是什么?" }
        ]
      }'
      
      使用 Docker 镜像
      docker run --gpus all \
        --shm-size 32g \
        -p 30000:30000 \
        -v ~/.cache/huggingface:/root/.cache/huggingface \
        --env "HF_TOKEN=" \
        --ipc=host \
        lmsysorg/sglang:latest \
        python3 -m sglang.launch_server \
          --model-path "Jackrong/Qwopus3.6-27B-v2-MTP-GGUF" \
          --host 0.0.0.0 \
          --port 30000
      # 使用 curl 调用服务器(兼容 OpenAI 的 API):
      curl -X POST "http://localhost:30000/v1/chat/completions" \
      -H "Content-Type: application/json" \
      --data '{
        "model": "Jackrong/Qwopus3.6-27B-v2-MTP-GGUF",
        "messages": [
          { "role": "user", "content": "法国的首都是什么?" }
        ]
      }'
      
    • Ollama (https://huggingface.co/Jackrong/Qwopus3.6-27B-v2-MTP-GGUF?local-app=ollama)
      如何使用 Ollama 调用 Jackrong/Qwopus3.6-27B-v2-MTP-GGUF:

      ollama run hf.co/Jackrong/Qwopus3.6-27B-v2-MTP-GGUF:Q4_K_M
      
    • Unsloth Studio new (https://huggingface.co/Jackrong/Qwopus3.6-27B-v2-MTP-GGUF?local-app=unsloth)
      如何使用 Unsloth Studio 调用 Jackrong/Qwopus3.6-27B-v2-MTP-GGUF:

      安装 Unsloth Studio(macOS、Linux、WSL)
      curl -fsSL https://unsloth.ai/install.sh | sh
      # 运行 unsloth studio
      unsloth studio -H 0.0.0.0 -p 8888
      # 然后在浏览器中打开 http://localhost:8888
      # 搜索 Jackrong/Qwopus3.6-27B-v2-MTP-GGUF 即可开始对话
      
      安装 Unsloth Studio(Windows)
      irm https://unsloth.ai/install.ps1 | iex
      # 运行 unsloth studio
      unsloth studio -H 0.0.0.0 -p 8888
      # 然后在浏览器中打开 http://localhost:8888
      # 搜索 Jackrong/Qwopus3.6-27B-v2-MTP-GGUF 即可开始对话
      
      使用 HuggingFace Spaces 运行 Unsloth
      # 无需额外设置
      # 在浏览器中打开 https://huggingface.co/spaces/unsloth/studio
      # 搜索 Jackrong/Qwopus3.6-27B-v2-MTP-GGUF 即可开始对话
      
    • Pinew (https://huggingface.co/Jackrong/Qwopus3.6-27B-v2-MTP-GGUF?local-app=pi)
      如何使用 Pi 调用 Jackrong/Qwopus3.6-27B-v2-MTP-GGUF:

      启动 llama.cpp 服务器
      # 安装 llama.cpp:
      brew install llama.cpp
      # 启动本地兼容 OpenAI 的服务器:
      llama-server -hf Jackrong/Qwopus3.6-27B-v2-MTP-GGUF:Q4_K_M
      
      在 Pi 中配置模型
      # 安装 Pi:
      npm install -g @mariozechner/pi-coding-agent
      # 添加到 ~/.pi/agent/models.json:
      {
        "providers": {
          "llama-cpp": {
            "baseUrl": "http://localhost:8080/v1",
            "api": "openai-completions",
            "apiKey": "none",
            "models": [
              { "id": "Jackrong/Qwopus3.6-27B-v2-MTP-GGUF:Q4_K_M" }
            ]
          }
        }
      }
      
      运行 Pi
      # 在项目目录中启动 Pi:
      pi
      
    • Hermes Agent new (https://huggingface.co/Jackrong/Qwopus3.6-27B-v2-MTP-GGUF?local-app=hermes-agent)
      如何使用 Hermes Agent 调用 Jackrong/Qwopus3.6-27B-v2-MTP-GGUF:

      启动 llama.cpp 服务器
      # 安装 llama.cpp:
      brew install llama.cpp
      # 启动本地兼容 OpenAI 的服务器:
      llama-server -hf Jackrong/Qwopus3.6-27B-v2-MTP-GGUF:Q4_K_M
      
      配置 Hermes
      # 安装 Hermes:
      curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash
      hermes setup
      # 将 Hermes 指向本地服务器:
      hermes config set model.provider custom
      hermes config set model.base_url http://127.0.0.1:8080/v1
      hermes config set model.default Jackrong/Qwopus3.6-27B-v2-MTP-GGUF:Q4_K_M
      
      运行 Hermes
      hermes
      
    • Docker Model Runner (https://huggingface.co/Jackrong/Qwopus3.6-27B-v2-MTP-GGUF?local-app=docker-model-runner)
      如何使用 Docker Model Runner 调用 Jackrong/Qwopus3.6-27B-v2-MTP-GGUF:

      docker model run hf.co/Jackrong/Qwopus3.6-27B-v2-MTP-GGUF:Q4_K_M
      
    • Lemonade (https://huggingface.co/Jackrong/Qwopus3.6-27B-v2-MTP-GGUF?local-app=lemonade)
      如何使用 Lemonade 调用 Jackrong/Qwopus3.6-27B-v2-MTP-GGUF:

      拉取模型
      # 从 https://lemonade-server.ai/ 下载 Lemonade
      lemonade pull Jackrong/Qwopus3.6-27B-v2-MTP-GGUF:Q4_K_M
      
      运行并与模型对话
      lemonade run user.Qwopus3.6-27B-v2-MTP-GGUF-Q4_K_M
      
      列出所有可用模型
      lemonade list
      

🪐 Qwopus3.6-27B-v2-MTP

MTP 发布 —— 基于 Qwen3.6-27B 微调的多 Token 预测推理模型

🧬 迹反转与负熵
🧠 27B 参数
⚡ 推测解码
🛠️ 编码 / DevOps / 数学

💡 什么是 Qwopus3.6-27B-v2-MTP?

🪐 Qwopus3.6-27B-v2-MTP 是一个面向速度的推理发布版本,构建在 Qwen3.6-27B 之上。它延续了 Qwopus 系列在重构推理轨迹、编码规范、DevOps 流程和数学推导方面的专注,同时新增了多 Token 预测以实现更快的生成。目标很简单:保留 27B 推理模型的深度与结构,同时让实际交互使用明显更快。

⚡ MTP 解码
辅助的未来 Token 预测可提高长推理、代码、数学和严格格式提示的吞吐量。

🧩 结构化推理
继承了围绕逐步推理轨迹重构构建的 Qwopus 训练配方。

🧪 GB10 测试
在包含逻辑、编码、DevOps、数学和边缘任务的 30 题本地基准上得到验证。

🚀 实际速度
专为需要强答案但又不希望每个任务多等几分钟的工作流程而设计。


💡 1. 基础模型、训练库与协作

🧠 1.1 基础模型规格(Qwen3.6-27B)

Qwen3.6-27B 为该发布版本提供了稠密的 27B 基础。Qwopus3.6-27B-v2-MTP 专注于保留基础模型的广泛推理能力,同时将输出风格调整为逐步分析、工具感知执行和实用工程答案。

属性规格与详情
🧠 架构稠密 Transformer / 27B 参数
🎯 重点领域智能体编码、DevOps、结构化逻辑、数学、严格格式输出
⚡ MTP 目标通过多 Token 推测预测提高生成吞吐量,同时保持最终答案质量

🧪 1.2 硬件协作与联合开发

本项目与硬件工程师 Kyle Hessling 紧密合作完成,其基础设施和训练支持使稳定的 27B 规模实验成为可能。

👉 您可以在 X / Twitter 上关注他了解硬件和模型训练动态:@KyleHessling1 (https://x.com/KyleHessling1)

🦥 1.3 微调框架(Unsloth)

模型训练工作流由 Unsloth 加速并优化内存使用。特别感谢 Unsloth 团队让高效的大模型微调变得更加可及。

⚙️ 1.4 自定义 MTP 头处理与自动化工具

本发布版采用针对 Qwen 系列多 Token 预测(MTP)头设计的自定义拆分与合并方法。自动化技能和完整的处理流程脚本已在 qwen-mtp-gguf (https://github.com/R6410418/Jackrong-llm-finetuning-guide/tree/main/qwen-mtp-gguf) 开源。

🌟 如果您觉得该工具包有用,请在 GitHub 上为项目点个星支持一下!

社区发布声明:Qwopus3.6-27B-v2-MTP 是面向研究、评估和工作流探索的实验性社区发布版本。


🚀 2. MTP 基准测试:Qwen3.6-27B vs Qwopus3.6-27B-v2-MTP

在涵盖逻辑、编码、DevOps、数学和边缘格式任务的 30 题基准测试中,Qwopus3.6-27B-v2-MTP 相比 Qwen3.6-27B 展现了明显的速度优势,同时生成了更紧凑的整体答案流。该基准测试不仅仅是原始吞吐量测试:它包括长编码提示、操作手册、数学推导和严格的约束输出案例。

  • 总体吞吐量:10.46 T/s,是 Qwen3.6-27B 的 1.66 倍

  • 节省延迟:2.34 小时,总时间减少 56.5%

  • Token 效率:整体完成 Token 减少 27.7%

  • 覆盖范围:30/30,所有基准提示均已完成

  • 速度:Qwopus3.6-27B-v2-MTP 达到总体 10.46 tokens/秒,而 Qwen3.6-27B 为 6.29 tokens/秒

  • 延迟:总评估时间从 14,901.69 秒 降至 6,487.81 秒,整个运行过程节省了 8,413.88 秒

  • 输出形态:MTP 生成了 67,862 个完成 Token,而 Qwen3.6-27B 为 93,802 个,整体响应轮廓更紧凑。

基准测试来源:GB10 服务器上的 /workspace/renji-training/Jackrong/qwopus3.6-27B-v2-MTP/benchmark_27b_pair_report.md。本地工作区日期:2026-05-22。


⚙️ 3. 测试环境与配置

  • 计算平台:GB10 专用服务器平台。
  • 评估格式:两个模型使用相同的本地 GGUF 服务器栈。
  • llama-server 总上下文49152
  • Temperature / Top-p1.0 / 0.95
  • 最大生成 Token:无明确上限;生成受请求预算约束。
  • 请求格式/v1/chat/completions,用户内容为文本负载。

基准测试汇总:Qwen3.6-27B vs Qwopus3.6-27B-v2-MTP

模型完成平均速度总体 T/s完成 Token总时间
Qwen3.6-27B306.326.2993,80214,901.69s
Qwopus3.6-27B-v2-MTP3010.6610.4667,8626,487.81s

领域级性能

领域问题数Qwen3.6-27B T/sMTP T/s延迟增益Qwen3.6-27B 时间MTP 时间Token 差异
逻辑56.3310.772.31x38.5 min16.7 min-26.3%
编码76.2610.272.25x1.52 h40.6 min-27.3%
DevOps66.2910.392.31x47.4 min20.5 min-28.5%
数学86.2911.002.35x1.01 h25.8 min-25.6%
边缘46.488.282.27x10.3 min4.5 min-43.6%

📊 4. 完整 30 题对比

下表使基准测试具体化:每一行都在相同提示下比较基础 Qwen3.6-27B 运行与 Qwopus MTP 运行。最显著的改进出现在严格输出、概率、DevOps 配置和中长编码任务上,而少数提示有意生成了更详细的 MTP 答案。

30 题详细对比

问题领域任务Qwen T/sQwen 时间Qwen TokenMTP T/sMTP 时间MTP Token结果模式
Q1逻辑错误标记的硬币盒6.369.4 min3,56911.402.3 min1,5304.16x 更快;更简洁
Q2逻辑工程师部署排序6.396.1 min2,34910.983.1 min2,0341.98x 更快;更简洁
Q3逻辑自指真值卡6.377.8 min2,99010.834.5 min2,9421.72x 更快;长度相近
Q4逻辑三个开关和灯泡6.323.6 min1,34210.441.6 min9992.21x 更快;更简洁
Q5逻辑HH vs TH 停止概率6.3011.6 min4,36710.625.2 min3,2662.25x 更快;更简洁
Q6编码流式 top-k 频率6.2813.8 min5,2109.9513.3 min7,9171.04x 更快;更丰富
Q7编码线程安全 TTL 缓存6.2818.6 min7,00910.645.3 min3,3673.52x 更快;更简洁
Q8编码区间合并实现6.2511.2 min4,20310.833.3 min2,1573.36x 更快;更简洁
Q9编码流式 CSV 转 JSONL6.2616.5 min6,20010.625.9 min3,7412.81x 更快;更简洁
Q10编码C++17 LRU 缓存6.2713.1 min4,92010.156.0 min3,6442.18x 更快;更简洁
Q11编码最高薪资员工 SQL6.296.1 min2,28310.372.4 min1,4752.54x 更快;更简洁
Q12编码原子 Bash 备份6.2812.1 min4,54510.334.4 min2,6952.76x 更快;更简洁
Q13DevOpsNginx 反向代理6.2910.4 min3,92410.882.8 min1,8213.70x 更快;更简洁

相似文章

Jackrong/Qwopus3.6-27B-Coder-MTP-GGUF

Hugging Face Models Trending

GGUF量化版本的Qwopus3.6-27B-Coder-MTP模型已发布在Hugging Face上,针对本地推理进行了优化,兼容Transformers、vLLM、SGLang和Unsloth Studio。

Jackrong/Qwopus3.6-27B-Coder-Compat-MTP-GGUF

Hugging Face Models Trending

Jackrong 发布了 Qwopus3.6-27B-Coder-Compat-MTP-GGUF,这是 Qwopus3.6-27B-Coder 模型的 GGUF 量化版本,并扩展了聊天模板,以提升与工具使用运行时及 OpenAI 兼容的代理框架的互操作性。

Jackrong/Qwopus3.6-27B-v2-GGUF

Hugging Face Models Trending

Qwopus3.6-27B-v2是Qwen3.6-27B的推理增强微调版本,使用Trace Inversion数据集和课程学习,以GGUF格式发布以实现高效推理。

Jackrong/Qwopus3.6-35B-A3B-v1-GGUF

Hugging Face Models Trending

Jackrong 发布 Qwopus3.6-35B-A3B-v1,基于阿里巴巴 Qwen3.6 MoE 模型的推理增强微调版本,针对逻辑推理和智能体编程优化,拥有 350 亿总参数和 30 亿激活参数。

Jackrong/Qwopus3.5-9B-Coder-MTP-GGUF

Hugging Face Models Trending

Jackrong 发布了 Qwopus3.5-9B-Coder-MTP-GGUF,这是一个基于 Qwen 的 9B 代码模型,采用多令牌预测 (MTP) 架构进行微调,相较于基模型实现了 35.8% 的吞吐量提升和 8.3% 的准确率提升,在代码和数学基准测试中取得满分。