@pupposandro: 兴奋地宣布 Lucebox 引擎现在可以在单张 AMD Radeon AI PRO R9700 (32 GB, RDNA4) 上运行 Qwen3.8-27B 模型,...
摘要
Lucebox 引擎现在支持在单张 AMD Radeon AI PRO R9700 GPU 上运行 Qwen3.8-27B 模型,使用 DFlash2 drafter 进行无损验证,在代码任务上最高可达 227 tok/s。
查看缓存全文
缓存时间: 2026/08/27 17:56
很高兴宣布,Lucebox引擎现已在单块AMD Radeon AI PRO R9700(32GB,RDNA4)上支持Qwen3.8-27B模型,采用来自z-lab的DFlash2块扩散草稿验证技术:
- 代码生成速度最高达227 token/s
- HumanEval基准测试平均208 token/s
- 数学推理速度达133 token/s
以上数据基于现成量化版本,该版本在HumanEval和GSM8K测试中表现与8位参考基准持平。
本方案完全无损:贪婪验证机制仅确认模型自身会生成的token,因此草稿技术仅改变答案获取速度,绝不影响答案内容。
完整技术解析请见下文。
相似文章
@pupposandro:在 Strix Halo 上比 llama.cpp 快 2.5 倍。我们刚刚为 AMD Ryzen AI MAX+ 395 iGPU(gfx1151,……)发布了 DFlash + PFlash
一套新工具集(DFlash + PFlash)在 AMD Ryzen AI MAX+ 395 iGPU 上实现了比 llama.cpp 快 2.5 倍的推理速度,展示了 Qwen3.6-27B 在 128 GiB 统一内存下的显著加速效果。
@ItsmeAjayKV: 成就解锁:得益于RTX 3090,现在我可以运行Qwen3.6-27b密集模型。正在运行 @Alibaba_Qwen Qwen 3…
用户使用llama.cpp在RTX 3090上对Qwen3.6-27B进行基准测试,实现了35 tok/s的生成速度和1247 tok/s的提示处理速度。
Qwen3.8-Flash-Next 将 4xR9700 变成一个本地AI强机!使用优化的vLLM,单请求120 t/s 生成速度和12k t/s 预填充
文章报道,Qwen3.8-Flash-Next 模型在配置了 4 个 AMD R9700 GPU 的系统上,使用优化的 vLLM 和自定义 Docker 镜像,实现了每秒 120 个 token 的生成速度和每秒 12k 个 token 的预填充速度。
@davideciffa: Lucebox 的大日子!Codex、Hermes 和 OpenClaw 现在可以在搭载 Qwen3.6-27B 的推测性推理引擎上本地运行。F…
Lucebox 宣布,Codex、Hermes 和 OpenClaw 现在可以使用其推测性推理引擎配合 Qwen3.6-27B 模型在本地运行,并提供完整的 OpenAI 工具调用兼容性。
在16GB显存的RTX 4080上运行Qwen3.8-27B的提速指南
本指南说明如何配置llama.cpp的DFlash2推测解码,以在配备16GB显存的RTX 4080 GPU上实现Qwen3.8-27B模型最高1.72倍的推理速度提升。