DeepSeek-V4-Flash-0731在2× Radeon AI PRO R9700上使用affinity引擎达到约40-50 tok/s(预构建量化+修复)

Reddit r/LocalLLaMA 新闻

摘要

文章报道了在两块Radeon AI PRO R9700 GPU上使用affinity推理引擎运行DeepSeek-V4-Flash-0731,通过预构建量化和稳定性修复,实现了40-50 tok/s的解码速度。

我一直在两块Radeon AI PRO R9700(每块32 GB,系统内存192 GB)上使用affinity(https://codeberg.org/StillDeadcode/affinity)运行DeepSeek-V4-Flash-0731,这是一个由**Yoshi Exeler (StillDeadcode)**专门编写的推理引擎,用于在一块或两块RDNA4显卡上运行DeepSeek-V4-Flash。所有引擎的功劳都归于他们。它将热点专家保留在GPU上,其余部分从主机内存流式传输,并运行DeepSeek原生的推测草稿。如果你有R9700,可以去看看。我添加的内容: - 一个预构建的0731量化版本,因此你可以跳过149 GB的下载和约2.5小时的量化过程:[neuromaniacmd/DeepSeek-V4-Flash-0731-affinity-2.875bpw](https://huggingface.co/neuromaniacmd/DeepSeek-V4-Flash-0731-affinity-2.875bpw)。它是使用affinity自己的量化器制作的:路由专家为2.875 bpw,team blobfish imatrix,密集权重为FP8,外加0731的捆绑草稿。它只能在affinity中加载,不能在llama.cpp或vLLM中使用。 - 一个包含一些稳定性修复的分支([github.com/neuromaniacMD/affinity](https://github.com/neuromaniacMD/affinity))。主要修复是:在2×32 GB显卡上,服务器在第一个长提示后会开始产生流畅的垃圾且无法恢复,这是由于在GPU映射下可用VRAM不足导致的大页崩溃。这些修复也作为PR提交到了上游。 - 在TheRock ROCm 7.14上有一个Docker构建,因此主机不需要安装ROCm。 我机器上的数据(2× R9700,加载时262K上下文完全分配): - 预填充:在4K-64K上下文下约1,260–1,360 tok/s - 解码:在长结构化回答上约40–50 tok/s,在自由散文和推理上约31–35 tok/s。这取决于草稿猜测被接受的频率。 - 在4K/16K/64K下的针在干草堆测试中3/3通过。 - 一个多轮代理任务(通过shell工具从Excel到DuckDB,15轮)通过了所有检查,没有格式错误的工具调用。 注意事项: - 仅限RDNA4(gfx1201),最多两块显卡。 - 使用模型卡上的采样设置(temp 1.0)。在temp 0.6时,这个量化版本对我来说会陷入推理循环。 - 你需要约64 GB或更多的RAM来处理不适合显卡的专家。 - 还有一个实验性的DeepSeek-V4.1-Flash分支。它现在是正确的,但在两块显卡上只有约14 tok/s。 很乐意回答问题。引擎问题应该属于上游项目。
查看原文

相似文章

DeepSeek V4 Flash on a Single AMD MI300X

Hacker News Top

This repository provides configuration, patches, and tuning to run the DeepSeek V4 Flash 304B checkpoint on a single AMD MI300X in production, achieving 168 tok/s decode without quantization. It includes correctness overlays for vLLM ROCm, AITER tuning tables, and a hybrid KV cache strategy.