slimserve

标签

Cards List
#slimserve

@QuixiAI: 教训总结:始终使用BF16 KV缓存。我之前用的是turboquant。是的,VRAM消耗很糟糕——所以另一个技巧是…

X AI KOLs Timeline · 4天前 缓存

作者分享了使用BF16 KV缓存而非turboquant进行AI模型优化的技术经验,并在SlimServe中为Qwen模型实现了CPU卸载以管理VRAM消耗。

0 人收藏 0 人点赞
#slimserve

@QuixiAI:我让 DeepSeek v4 Flash 0731 在 4x A100 上用 SlimServe 运行起来。单请求 175 tok/s,64 并发 1k tok/s…

X AI KOLs Timeline · 2026-08-10 缓存

QuixiAI 报告称,使用 SlimServe 在 4x A100 上运行 DeepSeek v4 Flash 0731,单请求达到 175 tok/s,64 并发请求达到 1k tok/s。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈