cpu-offloading

标签

Cards List
#cpu-offloading

@QuixiAI: 教训总结:始终使用BF16 KV缓存。我之前用的是turboquant。是的,VRAM消耗很糟糕——所以另一个技巧是…

X AI KOLs Timeline · 4天前 缓存

作者分享了使用BF16 KV缓存而非turboquant进行AI模型优化的技术经验,并在SlimServe中为Qwen模型实现了CPU卸载以管理VRAM消耗。

0 人收藏 0 人点赞
#cpu-offloading

[Deepseek-V4-Flash-0731] 在单张RTX5090 + DDR5桌面配置下,通过VLLM CPU/内存卸载实现完整1M上下文,~800 tps预填充 & 15+ tps解码 [智能体编码]

Reddit r/LocalLLaMA · 2026-08-04

关于在单张 RTX 5090 + 256GB DDR5 台式机上使用 vLLM 配合 CPU/内存卸载运行 DeepSeek-V4-Flash-0731 完整 100 万 token 上下文的技术报告,实现了约 800 tokens/秒的预填充速度和约 15 tokens/秒的解码速度。

0 人收藏 0 人点赞
#cpu-offloading

我们确实需要27B、35B、122B和397B规模的Qwen3.8

Reddit r/LocalLLaMA · 2026-07-27

作者认为,发布更小规模的Qwen模型(27B、35B、122B、397B)比专注于万亿参数的大模型更能服务本地AI社区,因为后者对大多数用户来说并不实用。

0 人收藏 0 人点赞
#cpu-offloading

DeepSeek V4 Flash(98GB)在单块4060 Ti加CPU上本周速度提升300% [从2t/s到7t/s]

Reddit r/LocalLLaMA · 2026-07-16

DeepSeek V4 Flash(98GB)现在通过CPU卸载,在单块RTX 4060 Ti上运行速度可达每秒7个token,相比上周的2t/s提升了3倍。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈