qwen3-flash-next

标签

Cards List
#qwen3-flash-next

Qwen3.8-Flash-Next 将 4xR9700 变成一个本地AI强机!使用优化的vLLM,单请求120 t/s 生成速度和12k t/s 预填充

Reddit r/LocalLLaMA · 昨天

文章报道,Qwen3.8-Flash-Next 模型在配置了 4 个 AMD R9700 GPU 的系统上,使用优化的 vLLM 和自定义 Docker 镜像,实现了每秒 120 个 token 的生成速度和每秒 12k 个 token 的预填充速度。

0 人收藏 0 人点赞
#qwen3-flash-next

llama.cpp 已合并对 Qwen3.8-Flash-Next 的支持

Reddit r/LocalLLaMA · 3天前 缓存

对 Qwen3.8-Flash-Next 模型的支持已合并至 llama.cpp,增强了其 C/C++ 本地大语言模型推理的能力。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈