标签
文章报道,Qwen3.8-Flash-Next 模型在配置了 4 个 AMD R9700 GPU 的系统上,使用优化的 vLLM 和自定义 Docker 镜像,实现了每秒 120 个 token 的生成速度和每秒 12k 个 token 的预填充速度。
对 Qwen3.8-Flash-Next 模型的支持已合并至 llama.cpp,增强了其 C/C++ 本地大语言模型推理的能力。