MTP 已发布 Qwen3.8-Flash-Next-GGUF
摘要
Qwen3.8-Flash-Next-GGUF 模型的 MTP 已发布,并提供了与 llama.cpp、vLLM 和 Ollama 等推理工具集成的详细部署说明。
查看缓存全文
缓存时间: 2026/09/01 12:59
unsloth/Qwen3.8-Flash-Next-GGUF 位于 main 分支
来源: https://huggingface.co/unsloth/Qwen3.8-Flash-Next-GGUF/tree/main/MTP 笔记本Google Colab (https://huggingface.co/unsloth/Qwen3.8-Flash-Next-GGUF/colab)Kaggle (https://huggingface.co/unsloth/Qwen3.8-Flash-Next-GGUF/kaggle)本地应用设置 (https://huggingface.co/settings/local-apps)llama.cpp (https://huggingface.co/unsloth/Qwen3.8-Flash-Next-GGUF?local-app=llama.cpp)如何在 llama.cpp 中使用 unsloth/Qwen3.8-Flash-Next-GGUF:
安装 (macOS, Linux)
`` curl -LsSf https://llama.app/install.sh | sh
启动一个带有 Web UI 的本地 OpenAI 兼容服务器:
llama serve -hf unsloth/Qwen3.8-Flash-Next-GGUF:UD-Q4_K_XL
直接在终端运行推理:
llama cli -hf unsloth/Qwen3.8-Flash-Next-GGUF:UD-Q4_K_XL ``
通过 WinGet 安装 (Windows)
`` winget install llama.cpp
启动一个带有 Web UI 的本地 OpenAI 兼容服务器:
llama serve -hf unsloth/Qwen3.8-Flash-Next-GGUF:UD-Q4_K_XL
直接在终端运行推理:
llama cli -hf unsloth/Qwen3.8-Flash-Next-GGUF:UD-Q4_K_XL ``
使用预编译二进制文件
``
从以下位置下载预编译二进制文件:
https://github.com/ggerganov/llama.cpp/releases
启动一个带有 Web UI 的本地 OpenAI 兼容服务器:
./llama-server -hf unsloth/Qwen3.8-Flash-Next-GGUF:UD-Q4_K_XL
直接在终端运行推理:
./llama-cli -hf unsloth/Qwen3.8-Flash-Next-GGUF:UD-Q4_K_XL ``
从源代码构建
`` git clone https://github.com/ggerganov/llama.cpp.git cd llama.cpp cmake -B build cmake –build build -j –target llama-server llama-cli
启动一个带有 Web UI 的本地 OpenAI 兼容服务器:
./build/bin/llama-server -hf unsloth/Qwen3.8-Flash-Next-GGUF:UD-Q4_K_XL
直接在终端运行推理:
./build/bin/llama-cli -hf unsloth/Qwen3.8-Flash-Next-GGUF:UD-Q4_K_XL ``
使用 Docker
docker model run hf.co/unsloth/Qwen3.8-Flash-Next-GGUF:UD-Q4_K_XL
LM StudioJanvLLM (https://huggingface.co/unsloth/Qwen3.8-Flash-Next-GGUF?local-app=vllm)如何在 vLLM 中使用 unsloth/Qwen3.8-Flash-Next-GGUF:
通过 pip 安装并提供模型服务
``
通过 pip 安装 vLLM:
pip install vllm
启动 vLLM 服务器:
vllm serve “unsloth/Qwen3.8-Flash-Next-GGUF”
使用 curl 调用服务器 (兼容 OpenAI 的 API):
curl -X POST “http://localhost:8000/v1/chat/completions”
-H “Content-Type: application/json”
–data ‘{
“model”: “unsloth/Qwen3.8-Flash-Next-GGUF”,
“messages”: [
{
“role”: “user”,
“content”: [
{
“type”: “text”,
“text”: “用一句话描述这张图片。”
},
{
“type”: “image_url”,
“image_url”: {
“url”: “https://cdn.britannica.com/61/93061-050-99147DCE/Statue-of-Liberty-Island-New-York-Bay.jpg”
}
}
]
}
]
}’
``
使用 Docker
docker model run hf.co/unsloth/Qwen3.8-Flash-Next-GGUF:UD-Q4_K_XL
Ollama (https://huggingface.co/unsloth/Qwen3.8-Flash-Next-GGUF?local-app=ollama)如何在 Ollama 中使用 unsloth/Qwen3.8-Flash-Next-GGUF:
ollama run hf.co/unsloth/Qwen3.8-Flash-Next-GGUF:UD-Q4_K_XL
Unsloth DesktopPi (https://huggingface.co/unsloth/Qwen3.8-Flash-Next-GGUF?local-app=pi)如何在 Pi 中使用 unsloth/Qwen3.8-Flash-Next-GGUF:
启动 llama.cpp 服务器
``
安装 llama.cpp:
brew install llama.cpp
启动一个本地 OpenAI 兼容服务器:
llama serve -hf unsloth/Qwen3.8-Flash-Next-GGUF:UD-Q4_K_XL ``
在 Pi 中配置模型
``
安装 Pi:
npm install -g @earendil-works/pi-coding-agent
添加到 ~/.pi/agent/models.json:
{ “providers”: { “llama-cpp”: { “baseUrl”: “http://localhost:8080/v1”, “api”: “openai-completions”, “apiKey”: “none”, “models”: [ { “id”: “unsloth/Qwen3.8-Flash-Next-GGUF:UD-Q4_K_XL” } ] } } } ``
运行 Pi
``
在你的项目目录启动 Pi:
pi ``
Docker Model Runner (https://huggingface.co/unsloth/Qwen3.8-Flash-Next-GGUF?local-app=docker-model-runner)如何在 Docker Model Runner 中使用 unsloth/Qwen3.8-Flash-Next-GGUF:
docker model run hf.co/unsloth/Qwen3.8-Flash-Next-GGUF:UD-Q4_K_XL
Lemonade (https://huggingface.co/unsloth/Qwen3.8-Flash-Next-GGUF?local-app=lemonade)如何在 Lemonade 中使用 unsloth/Qwen3.8-Flash-Next-GGUF:
拉取模型
``
从 https://lemonade-server.ai/ 下载 Lemonade
lemonade pull unsloth/Qwen3.8-Flash-Next-GGUF:UD-Q4_K_XL ``
运行并与模型聊天
lemonade run user.Qwen3.8-Flash-Next-GGUF-UD-Q4_K_XL
列出所有可用模型
lemonade list
Hermes Agent (https://huggingface.co/unsloth/Qwen3.8-Flash-Next-GGUF?local-app=hermes-agent)如何在 Hermes Agent 中使用 unsloth/Qwen3.8-Flash-Next-GGUF:
启动 llama.cpp 服务器
``
安装 llama.cpp:
brew install llama.cpp
启动一个本地 OpenAI 兼容服务器:
llama serve -hf unsloth/Qwen3.8-Flash-Next-GGUF:UD-Q4_K_XL ``
配置 Hermes
``
安装 Hermes:
curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash hermes setup
将 Hermes 指向本地服务器:
hermes config set model.provider custom hermes config set model.base_url http://127.0.0.1:8080/v1 hermes config set model.default unsloth/Qwen3.8-Flash-Next-GGUF:UD-Q4_K_XL ``
运行 Hermes
hermes
Atomic ChatOpenClaw (https://huggingface.co/unsloth/Qwen3.8-Flash-Next-GGUF?local-app=openclaw)如何在 OpenClaw 中使用 unsloth/Qwen3.8-Flash-Next-GGUF:
启动 llama.cpp 服务器
``
安装 llama.cpp:
brew install llama.cpp
启动一个本地 OpenAI 兼容服务器:
llama serve -hf unsloth/Qwen3.8-Flash-Next-GGUF:UD-Q4_K_XL ``
配置 OpenClaw
``
安装 OpenClaw:
npm install -g openclaw@latest
注册本地服务器并将其设为默认模型:
openclaw onboard –non-interactive –mode local
–auth-choice custom-api-key
–custom-base-url http://127.0.0.1:8080/v1
–custom-model-id “unsloth/Qwen3.8-Flash-Next-GGUF:UD-Q4_K_XL”
–custom-provider-id llama-cpp
–custom-compatibility openai
–custom-text-input
–accept-risk
–skip-health
``
运行 OpenClaw
openclaw agent --local --agent main --message "Hello from Hugging Face"
相似文章
Qwen3.8-Flash-Next MTP 集成至 ik_llama.cpp(集成头或单独 -md 文件)... 在 5090 + 128GB 上 45 → 90 tok/s,甚至可在 12GB 4070 上运行
文章详细描述了将 Multi-Token Prediction (MTP) 支持合并至 ik_llama.cpp 的过程,这显著提升了 Qwen3.8-Flash-Next 模型的令牌生成速度,基准测试显示在高端硬件上速度最高可提升一倍。
havenoammo/Qwen3.6-27B-MTP-UD-GGUF
该 Hugging Face 仓库提供了 Qwen3.6-27B 的 GGUF 文件,这些文件在 Unsloth UD XL 量化版本的基础上嫁接了多 Token 预测 (MTP) 层。它还包含了构建支持 MTP 的 llama.cpp 的说明,以实现投机解码。
在 Qwen3.6 - RTX 5090 上测试 llama.cpp 的 MTP 支持
在 RTX 5090 上使用 Qwen3.6 模型对 llama.cpp 的新多标记预测(MTP)支持进行技术测试,比较不同提示和 GGUF 量化下开启和关闭 MTP 的性能表现。
@ggerganov: llama.cpp 为 Qwen3.6 系列添加 MTP 支持,这是本地AI生态系统的一个重要里程碑。性能提…
llama.cpp 为 Qwen3.6 系列添加了多令牌预测(MTP)支持,为在普通硬件上进行本地AI推理带来了巨大的性能提升。
Llama.cpp B9406 MTP mmproj 修复
Llama.cpp 版本 B9406 修复了在使用 MTP 和 MoE 视觉模型(例如 Qwen3.6-35B-A3B)时出现的崩溃问题 (GGML_ASSERT)。