vram-optimization

标签

Cards List
#vram-optimization

动态KV缓存量化与按需加载mmproj/MTP:我的llama.cpp愿望清单

Reddit r/LocalLLaMA · 2026-06-04

一位开发者已为llama.cpp实现了一个概念验证的PR,通过HTTP端点添加了动态KV缓存量化功能,允许用户按需重新量化其KV缓存,而无需完全重新加载模型。该帖子还概述了一个愿望清单,包括按需加载mmproj/MTP交换以及用于上下文优化的自动--fit标志。

0 人收藏 0 人点赞
#vram-optimization

llama: 使用f16掩膜进行FA以节省VRAM(作者 am17an)· 拉取请求 #23764 · ggml-org/llama.cpp

Reddit r/LocalLLaMA · 2026-05-29 缓存

此拉取请求针对llama.cpp推理引擎,实现了使用f16掩膜的Flash Attention以减少VRAM使用。

0 人收藏 0 人点赞
#vram-optimization

专家优先的llama.cpp

Reddit r/LocalLLaMA · 2026-05-22

一位开发者创建了llama.cpp的实验性分支,该分支仅将已使用的专家(expert)而非完整层卸载到显存,从而在RTX 2060 12GB等显存有限的GPU上为MoE模型带来了速度提升。作者正在寻找测试者,以验证其在其他Nvidia GPU上的性能表现。

0 人收藏 0 人点赞
#vram-optimization

llama.cpp 的 auto fit 远比我想象的好用

Reddit r/LocalLLaMA · 2026-04-21

llama.cpp 新增的 --fit 标志让超大模型也能在显存不足时高速运行,轻松突破显存限制,速度依旧惊人。

0 人收藏 0 人点赞
#vram-optimization

QWEN3.6 + ik_llama 快得离谱

Reddit r/LocalLLaMA · 2026-04-19

用户报告成功部署 Qwen 3.6 与 ik_llama 量化,在消费级硬件(16GB VRAM、32GB RAM)上实现 200k 上下文窗口下 50+ token/秒。

0 人收藏 0 人点赞
← Previous
← 返回首页

提交意见反馈