标签
CommitKV提出了一种面向多轮ReAct智能体的生命周期感知KV缓存压缩方法,通过提交转换区分休眠令牌与已完成令牌,以减少内存使用并加速推理。
作者为 Mference 添加了 Maple-Preview 支持。Mference 是一款通过从磁盘流式加载 MoE 专家来在低内存设备上运行大型模型的工具,作者在 Air M4 上实现了仅用 500MB 内存达到 40 tps 的速度。
重点介绍了一篇引入 ZeRO(零冗余优化器)的文章,这是一种内存优化系统,用于在有限的 GPU 内存上高效训练超大规模模型。
介绍 Iris Ai,一个在消费级硬件上将查询路由至8个专用LLM的系统,通过每次仅激活一个模型和动态模型交换,以低内存实现大模型性能。
AnchorKV is a new KV cache compression scheme that shrinks the cache by 20x without discarding any tokens, using anchor-residual representations to preserve 99% of full-cache accuracy at the 70B scale. The paper is a preprint under review.
讨论了如何在仅有 500MB 内存的设备上运行 Gemma 4,可能通过量化或其他优化技术实现。
关于在单张 RTX 5090 + 256GB DDR5 台式机上使用 vLLM 配合 CPU/内存卸载运行 DeepSeek-V4-Flash-0731 完整 100 万 token 上下文的技术报告,实现了约 800 tokens/秒的预填充速度和约 15 tokens/秒的解码速度。
演示了在 Mac 上仅用 4.3 GB 内存运行 80B Qwen 模型,以及在 iPhone 上运行 35B 模型,展示了本地 LLM 推理的极致内存优化。
PyTorch 2.13 发布版为 Apple Silicon 带来 FlexAttention,通过融合的 LinearCrossEntropyLoss 实现高达 12 倍加速,并将大词表模型的峰值内存降低 4 倍,同时还更新了分布式训练、编译和端侧推理。
在配备6GB RTX 4050的笔记本上测试1.56TB混合专家模型,需借助NVMe进行修补式内存流式传输,解码速度达到0.106 tokens/s。
Valkey使用如listpack和hashtable等不同的编码方式来处理其数据类型,以平衡内存和性能;了解这些内部结构可以显著节省内存。
AirLLM 是一个开源工具,通过分层流式加载,使得在单张8GB游戏显卡上运行4050亿参数模型成为可能,免费使用,采用Apache 2.0许可证。
Google 开源了一个向量索引,将 31GB 的 AI 内存压缩到 4GB,可容纳 1000 万文档,搜索速度比 FAISS 更快,且无需训练或 GPU。
一种无需量化或重新训练即可从 GLM-5.2(753B 权重)中移除 423 GB 的技术,通过在 VRAM 中保持权重压缩状态实现逐比特精确压缩。
MosaicKV引入了用于长上下文LLM服务的动态二维KV缓存压缩,实现了高达16倍的注意力加速和3倍的内存减少,且精度损失极小。
提出Block-GTQ,一种感知RoPE的KV缓存量化比特分配方法,通过为高能量RoPE块分配更多比特,提升长上下文性能与内存效率。
深入理解 FlashAttention 的可视化讲解,涵盖内存优化和算子融合,以实现语言模型训练中的高效注意力计算。
逆向工程 Qualcomm NPU 编译器揭示了未文档化的 VTCM 内存管理、基于 MILP 的布局、自动精度更改,以及一个用于边缘部署优化的隐藏分析模拟器(Hextimate)。
LMCache 是一个 KV 缓存管理层,通过缓存并复用 KV cache 来加速大模型推理、降低显存消耗,已获 9.2K star 并加入 PyTorch 基金会,被 NVIDIA Dynamo 集成。
在sm120上使用NVFP4 KV缓存量化显著提高了大语言模型的内存效率,使32GB VRAM系统在196k上下文大小下使用Qwen3.6-27B实现约60 tok/秒的推理速度。