现在可以在 AMD NPU 上通过 FastFlowLM 运行 Qwen 3.8 27B(解码速度约 1 tps)
摘要
AMD 的 ROCm/FastFlowLM 现已支持在 Ryzen AI XDNA2 NPU 上运行 Qwen 3.8 27B(以及其它 MoE、视觉、音频和嵌入模型),无需 GPU,最高支持 256k 上下文,运行时仅 17 MB 轻量级——不过 27B 模型的解码速度被指出仅为较慢的 1 token/s。
查看缓存全文
缓存时间: 2026/09/30 20:26
ROCm/FastFlowLM 来源: https://github.com/ROCm/FastFlowLM
⚡ FastFlowLM (FLM) — 释放 Ryzen™ AI NPU 的算力
在分钟级别内,即可在 AMD Ryzen™ AI NPU 上运行大语言模型 — 现已支持视觉(Vision)、音频(Audio)、嵌入(Embedding) 和 MoE。
无需 GPU。速度更快,能效提升超过 10 倍。支持最长 256k token 的上下文长度。超轻量(17 MB)。20 秒内即可完成安装。
📦 唯一开箱即用、专为 Ryzen™ AI 打造的 NPU 优先运行时。
🤝 熟悉的单命令 CLI — 为 NPU 深度优化。
✨ 从闲置的芯片到即刻释放性能 — FastFlowLM 让 Ryzen™ AI 焕发光彩。
FastFlowLM (FLM) 支持所有搭载 XDNA2 NPU 的 Ryzen™ AI 系列芯片(Strix、Strix Halo、Kraken 和 Gorgon Point)。
🚀 快速开始
打包好的 FLM Windows 安装程序可在此下载:flm-setup.msi(https://github.com/ROCm/FastFlowLM/releases/latest/download/flm-setup.msi)。更多详情请参阅发布说明(https://github.com/ROCm/FastFlowLM/releases/)。
📺 观看快速开始视频(Windows)(https://www.youtube.com/watch?v=mYOfDNkyBII)
⚠️ 请使用最新版 AMD NPU 驱动 — 32.0.203.311 或更高版本(可通过任务管理器 → 性能 → NPU,或设备管理器查看)。更早的版本已不再受支持。
⚙️ 提示:
- 推荐:尝试运行 Windows Update 或从驱动下载页面(https://www.amd.com/en/support) 下载。
- AMD 官方安装文档(https://ryzenai.docs.amd.com/en/latest/inst.html#install-npu-drivers) (需要 AMD 账户)。
- 非官方论坛下载(https://www.elevenforum.com/t/drivers-amd-npu-ryzen-8xxx-9xxx-apu.24220/) (注意:这些是未经 AMD 验证的第三方内容;请自行承担下载和使用的风险)。
安装完成后,打开 PowerShell(Win + X → I)。
在终端中运行模型(CLI 模式):
flm run llama3.2:1b
说明:
- 下载优化后的模型内核需要能访问 HuggingFace。
- 有时从 HuggingFace 的下载可能会损坏。如果出现这种情况,请运行
flm pull --force(例如flm pull llama3.2:1b --force)重新下载并修复。- 默认情况下,模型存储在:
- Windows:
C:\Users\<用户名>\.flm\models\- Linux:
~/.config/flm/- 在 Windows 上安装时,你可以选择其他基础文件夹(例如,如果你选择了
C:\Users\<用户名>\flm,模型将保存在C:\Users\<用户名>\flm\models\下)。- 在 Linux 上,你可以通过设置
FLM_MODEL_PATH环境变量来覆盖默认位置。- 要禁用启动时的版本检查,请设置
FLM_DISABLE_UPDATE_CHECK=1。- ⚠️ 如果你所在地区无法访问 HuggingFace,请手动下载模型(请查看此 issue(https://github.com/ROCm/FastFlowLM/issues/2)),并将其放入所选目录中。
🎉🚀 FastFlowLM (FLM) 已就绪 — 你的 NPU 已被解锁,可以立即开始与模型对话了!
打开任务管理器(Ctrl + Shift + Esc)。切换到性能选项卡 → 点击 NPU 即可监控使用情况。
⚡ 快捷提示:
- 在会话中使用
/verbose开启性能报告(再次输入/verbose可关闭)。- 输入
/bye退出对话。- 在 PowerShell 中运行
flm list可查看所有可用模型。
启动本地服务器(服务器模式):
flm serve llama3.2:1b
模型标签(例如
llama3.2:1b)用于设置初始模型,此参数是可选的。如果请求了其他模型,FastFlowLM 会自动切换到该模型。本地服务器默认运行在端口 52625 上。
FastFlowLM 文档(https://fastflowlm.com/docs/instructions/)
🧠 NPU 上的本地 AI
借助 FLM,你可以轻松地在本地运行前沿的 LLM(现在也支持 VLM),具有以下优势:
- ⚡ 快速且低功耗
- 🧰 简单的 CLI 和 API(REST 和 OpenAI API)
- 🔐 完全私密,完全离线
无需改写模型,无需调优 — 开箱即用。
📄 许可证
- 所有编排代码和 CLI 工具均以 MIT 许可证开源。
- 这些 NPU 加速二进制内核完全免费,可用于任何用途,包括商业用途。
- 请在你的 README/项目页面(或产品)中按以下方式致谢 FastFlowLM:
Powered by FastFlowLM (https://github.com/ROCm/FastFlowLM)
🙏 致谢
- 依托先进的 AMD Ryzen™ AI NPU 架构
- 受广泛使用的 llama.cpp(https://github.com/ggml-org/llama.cpp)和 Ollama(https://github.com/ollama/ollama)启发
- 分词加速采用 MLC-ai/tokenizers-cpp(https://github.com/mlc-ai/tokenizers-cpp)
- 聊天格式化采用 Google/minja(https://github.com/google/minja)
- 底层内核使用强大的 IRON(https://github.com/amd/iron)+ AIE-MLIR(https://github.com/Xilinx/mlir-aie)进行优化
🛠️ 从源码构建
对于希望从源码构建 FastFlowLM 的开发者,我们提供了 CMake 预设,以获得便捷、一致的构建体验。
前置条件
- Git
- CMake(版本 3.22 或更高)
- 兼容 C++20 的编译器(例如 GCC、Clang、MSVC)
- Ninja(推荐)
构建说明
关于确切的操作步骤以及需要安装的依赖项,Linux 用户可以在 linux-getting-started.md 中找到更多详细信息。
- 克隆仓库:
git clone --recursive https://github.com/ROCm/FastFlowLM.git
cd FastFlowLM/src
- 使用预设配置 CMake:
- Linux:
cmake --preset linux-default
这将配置构建,安装到 /opt/fastflowlm。
- Windows(在开发者命令提示符中):
cmake --preset windows-default
- 构建项目:
cmake --build build
- 安装项目(可选):
- Linux:
sudo cmake --install build
- Windows(需要管理员权限):
cmake --install build
相似文章
@pupposandro: 兴奋地宣布 Lucebox 引擎现在可以在单张 AMD Radeon AI PRO R9700 (32 GB, RDNA4) 上运行 Qwen3.8-27B 模型,...
Lucebox 引擎现在支持在单张 AMD Radeon AI PRO R9700 GPU 上运行 Qwen3.8-27B 模型,使用 DFlash2 drafter 进行无损验证,在代码任务上最高可达 227 tok/s。
在16GB显存的RTX 4080上运行Qwen3.8-27B的提速指南
本指南说明如何配置llama.cpp的DFlash2推测解码,以在配备16GB显存的RTX 4080 GPU上实现Qwen3.8-27B模型最高1.72倍的推理速度提升。
我在不到20美元的CPU芯片上,以不足512MiB的内存运行了Qwen3.5-0.8B
作者在10-20美元的Amlogic A113X CPU芯片上,使用自定义C运行时运行了Qwen3.5-0.8B,实现了1.82 tok/s的解码速度和低于490 MiB的峰值RSS,证明了小型LLM推理可以在没有GPU的已部署边缘硬件上运行。
价值100美元的GPU以7.39 t/s运行Qwen 3.8 27b模型
一位用户演示在两张RX 580 GPU上运行量化为Q3_K_M的Qwen 27b AI模型,使用价值低于100美元的旧DDR3硬件,达到7.39 tokens/秒的性能。
在单张 AMD Radeon R9700 上运行 Qwen3.8 27b NVFP4 达 153 tok/s,8 并发请求下 470 tok/s,预填充速度 3,619 tok/s
优化了在单张 AMD Radeon R9700 GPU 上运行 Qwen3.8 27b NVFP4 模型的性能,解码速度高达每秒 153 个令牌,预填充速度达每秒 3,619 个令牌,并提升了并发性能。