现在可以在 AMD NPU 上通过 FastFlowLM 运行 Qwen 3.8 27B(解码速度约 1 tps)

Reddit r/LocalLLaMA 工具

摘要

AMD 的 ROCm/FastFlowLM 现已支持在 Ryzen AI XDNA2 NPU 上运行 Qwen 3.8 27B(以及其它 MoE、视觉、音频和嵌入模型),无需 GPU,最高支持 256k 上下文,运行时仅 17 MB 轻量级——不过 27B 模型的解码速度被指出仅为较慢的 1 token/s。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/09/30 20:26

ROCm/FastFlowLM 来源: https://github.com/ROCm/FastFlowLM

⚡ FastFlowLM (FLM) — 释放 Ryzen™ AI NPU 的算力

在分钟级别内,即可在 AMD Ryzen™ AI NPU 上运行大语言模型 — 现已支持视觉(Vision)、音频(Audio)、嵌入(Embedding) 和 MoE。

无需 GPU。速度更快,能效提升超过 10 倍。支持最长 256k token 的上下文长度。超轻量(17 MB)。20 秒内即可完成安装。

📦 唯一开箱即用、专为 Ryzen™ AI 打造的 NPU 优先运行时。

🤝 熟悉的单命令 CLI — 为 NPU 深度优化。

✨ 从闲置的芯片到即刻释放性能 — FastFlowLM 让 Ryzen™ AI 焕发光彩。

FastFlowLM (FLM) 支持所有搭载 XDNA2 NPU 的 Ryzen™ AI 系列芯片(Strix、Strix Halo、Kraken 和 Gorgon Point)。

🚀 快速开始

打包好的 FLM Windows 安装程序可在此下载:flm-setup.msi(https://github.com/ROCm/FastFlowLM/releases/latest/download/flm-setup.msi)。更多详情请参阅发布说明(https://github.com/ROCm/FastFlowLM/releases/)。

📺 观看快速开始视频(Windows)(https://www.youtube.com/watch?v=mYOfDNkyBII)

⚠️ 请使用最新版 AMD NPU 驱动 — 32.0.203.311 或更高版本(可通过任务管理器 → 性能 → NPU,或设备管理器查看)。更早的版本已不再受支持。

⚙️ 提示:

  • 推荐:尝试运行 Windows Update 或从驱动下载页面(https://www.amd.com/en/support) 下载。
  • AMD 官方安装文档(https://ryzenai.docs.amd.com/en/latest/inst.html#install-npu-drivers) (需要 AMD 账户)。
  • 非官方论坛下载(https://www.elevenforum.com/t/drivers-amd-npu-ryzen-8xxx-9xxx-apu.24220/) (注意:这些是未经 AMD 验证的第三方内容;请自行承担下载和使用的风险)。

安装完成后,打开 PowerShell(Win + X → I)。

在终端中运行模型(CLI 模式):

flm run llama3.2:1b

说明:

  • 下载优化后的模型内核需要能访问 HuggingFace。
  • 有时从 HuggingFace 的下载可能会损坏。如果出现这种情况,请运行 flm pull --force(例如 flm pull llama3.2:1b --force)重新下载并修复。
  • 默认情况下,模型存储在:
    • Windows:C:\Users\<用户名>\.flm\models\
    • Linux:~/.config/flm/
  • 在 Windows 上安装时,你可以选择其他基础文件夹(例如,如果你选择了 C:\Users\<用户名>\flm,模型将保存在 C:\Users\<用户名>\flm\models\ 下)。
  • 在 Linux 上,你可以通过设置 FLM_MODEL_PATH 环境变量来覆盖默认位置。
  • 要禁用启动时的版本检查,请设置 FLM_DISABLE_UPDATE_CHECK=1。
  • ⚠️ 如果你所在地区无法访问 HuggingFace,请手动下载模型(请查看此 issue(https://github.com/ROCm/FastFlowLM/issues/2)),并将其放入所选目录中。

🎉🚀 FastFlowLM (FLM) 已就绪 — 你的 NPU 已被解锁,可以立即开始与模型对话了!

打开任务管理器(Ctrl + Shift + Esc)。切换到性能选项卡 → 点击 NPU 即可监控使用情况。

⚡ 快捷提示:

  • 在会话中使用 /verbose 开启性能报告(再次输入 /verbose 可关闭)。
  • 输入 /bye 退出对话。
  • 在 PowerShell 中运行 flm list 可查看所有可用模型。

启动本地服务器(服务器模式):

flm serve llama3.2:1b

模型标签(例如 llama3.2:1b)用于设置初始模型,此参数是可选的。如果请求了其他模型,FastFlowLM 会自动切换到该模型。本地服务器默认运行在端口 52625 上。

FastFlowLM 文档(https://fastflowlm.com/docs/instructions/)

🧠 NPU 上的本地 AI

借助 FLM,你可以轻松地在本地运行前沿的 LLM(现在也支持 VLM),具有以下优势:

  • ⚡ 快速且低功耗
  • 🧰 简单的 CLI 和 API(REST 和 OpenAI API)
  • 🔐 完全私密,完全离线

无需改写模型,无需调优 — 开箱即用。

📄 许可证

  • 所有编排代码和 CLI 工具均以 MIT 许可证开源。
  • 这些 NPU 加速二进制内核完全免费,可用于任何用途,包括商业用途。
  • 请在你的 README/项目页面(或产品)中按以下方式致谢 FastFlowLM:
Powered by FastFlowLM (https://github.com/ROCm/FastFlowLM)

🙏 致谢

  • 依托先进的 AMD Ryzen™ AI NPU 架构
  • 受广泛使用的 llama.cpp(https://github.com/ggml-org/llama.cpp)和 Ollama(https://github.com/ollama/ollama)启发
  • 分词加速采用 MLC-ai/tokenizers-cpp(https://github.com/mlc-ai/tokenizers-cpp)
  • 聊天格式化采用 Google/minja(https://github.com/google/minja)
  • 底层内核使用强大的 IRON(https://github.com/amd/iron)+ AIE-MLIR(https://github.com/Xilinx/mlir-aie)进行优化

🛠️ 从源码构建

对于希望从源码构建 FastFlowLM 的开发者,我们提供了 CMake 预设,以获得便捷、一致的构建体验。

前置条件

  • Git
  • CMake(版本 3.22 或更高)
  • 兼容 C++20 的编译器(例如 GCC、Clang、MSVC)
  • Ninja(推荐)

构建说明

关于确切的操作步骤以及需要安装的依赖项,Linux 用户可以在 linux-getting-started.md 中找到更多详细信息。

  1. 克隆仓库:
git clone --recursive https://github.com/ROCm/FastFlowLM.git
cd FastFlowLM/src
  1. 使用预设配置 CMake:
  • Linux:
cmake --preset linux-default

这将配置构建,安装到 /opt/fastflowlm。

  • Windows(在开发者命令提示符中):
cmake --preset windows-default
  1. 构建项目:
cmake --build build
  1. 安装项目(可选):
  • Linux:
sudo cmake --install build
  • Windows(需要管理员权限):
cmake --install build

相似文章