expert-cache

标签

Cards List
#expert-cache

Qwen3.8-Flash-Next 在双 RTX 3090 + DDR4 上:解码速度从 17 提升至 25-29 令牌/秒,使用专家缓存 PR

Reddit r/LocalLLaMA · 2026-09-03

用户基准测试并详述了 llama.cpp 中的 GPU 常驻专家缓存 PR,该 PR 将 Qwen3.8-Flash-Next 在双 RTX 3090 系统上的解码速度从 17 提升至 25-29 令牌/秒。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈