memory-optimization

标签

Cards List
#memory-optimization

CommitKV:通过提交转换实现的多轮智能体生命周期感知KV缓存压缩

arXiv cs.LG · 昨天 缓存

CommitKV提出了一种面向多轮ReAct智能体的生命周期感知KV缓存压缩方法,通过提交转换区分休眠令牌与已完成令牌,以减少内存使用并加速推理。

0 人收藏 0 人点赞
#memory-optimization

我已将 Maple-Preview 添加到 Mference,在 Air M4 上仅用 500MB 内存实现了 40 tps 的生成速度

Reddit r/LocalLLaMA · 2天前

作者为 Mference 添加了 Maple-Preview 支持。Mference 是一款通过从磁盘流式加载 MoE 专家来在低内存设备上运行大型模型的工具,作者在 Air M4 上实现了仅用 500MB 内存达到 40 tps 的速度。

0 人收藏 0 人点赞
#memory-optimization

@v0xium:一篇很棒的文章,介绍了 ZeRO(零冗余优化器),这是一套内存优化系统,用于高效……

X AI KOLs Timeline · 4天前 缓存

重点介绍了一篇引入 ZeRO(零冗余优化器)的文章,这是一种内存优化系统,用于在有限的 GPU 内存上高效训练超大规模模型。

0 人收藏 0 人点赞
#memory-optimization

我如何仅用24GB内存运行193B参数模型

Reddit r/ArtificialInteligence · 6天前

介绍 Iris Ai,一个在消费级硬件上将查询路由至8个专用LLM的系统,通过每次仅激活一个模型和动态模型交换,以低内存实现大模型性能。

0 人收藏 0 人点赞
#memory-optimization

AnchorKV: Anchor-Residual KV Cache Compression

arXiv cs.LG · 2026-08-05 缓存

AnchorKV is a new KV cache compression scheme that shrinks the cache by 20x without discarding any tokens, using anchor-residual representations to preserve 99% of full-cache accuracy at the 70B scale. The paper is a preprint under review.

0 人收藏 0 人点赞
#memory-optimization

在 500MB 内存上运行 Gemma 4

Reddit r/LocalLLaMA · 2026-08-04

讨论了如何在仅有 500MB 内存的设备上运行 Gemma 4,可能通过量化或其他优化技术实现。

0 人收藏 0 人点赞
#memory-optimization

[Deepseek-V4-Flash-0731] 在单张RTX5090 + DDR5桌面配置下,通过VLLM CPU/内存卸载实现完整1M上下文,~800 tps预填充 & 15+ tps解码 [智能体编码]

Reddit r/LocalLLaMA · 2026-08-04

关于在单张 RTX 5090 + 256GB DDR5 台式机上使用 vLLM 配合 CPU/内存卸载运行 DeepSeek-V4-Flash-0731 完整 100 万 token 上下文的技术报告,实现了约 800 tokens/秒的预填充速度和约 15 tokens/秒的解码速度。

0 人收藏 0 人点赞
#memory-optimization

Show HN:在 Mac 上仅用 4.3 GB 内存运行 80B Qwen,以及在 iPhone 上运行 35B

Hacker News Top · 2026-08-03

演示了在 Mac 上仅用 4.3 GB 内存运行 80B Qwen 模型,以及在 iPhone 上运行 35B 模型,展示了本地 LLM 推理的极致内存优化。

0 人收藏 0 人点赞
#memory-optimization

@PyTorch:PyTorch 2.13 为 Apple Silicon 带来 FlexAttention,借助 nn.Li… 将大词表模型的峰值内存最高削减 4×

X AI KOLs Following · 2026-07-31 缓存

PyTorch 2.13 发布版为 Apple Silicon 带来 FlexAttention,通过融合的 LinearCrossEntropyLoss 实现高达 12 倍加速,并将大词表模型的峰值内存降低 4 倍,同时还更新了分布式训练、编译和端侧推理。

0 人收藏 0 人点赞
#memory-optimization

我在一台6GB RTX 4050笔记本上尝试运行1.56TB MoE模型,结果如下

Reddit r/LocalLLaMA · 2026-07-29

在配备6GB RTX 4050的笔记本上测试1.56TB混合专家模型,需借助NVMe进行修补式内存流式传输,解码速度达到0.106 tokens/s。

0 人收藏 0 人点赞
#memory-optimization

Valkey中数据的隐秘生活

Lobsters Hottest · 2026-07-26 缓存

Valkey使用如listpack和hashtable等不同的编码方式来处理其数据类型,以平衡内存和性能;了解这些内部结构可以显著节省内存。

0 人收藏 0 人点赞
#memory-optimization

@dunik_7: 他让4050亿参数的模型在单张8GB游戏显卡上运行。他没有将其转为付费服务,而是开源了……

X AI KOLs Timeline · 2026-07-16 缓存

AirLLM 是一个开源工具,通过分层流式加载,使得在单张8GB游戏显卡上运行4050亿参数模型成为可能,免费使用,采用Apache 2.0许可证。

0 人收藏 0 人点赞
#memory-optimization

@thesupermanmx: SAM ALTMAN 疯了。Google 刚刚将 AI 内存从 31GB 压缩到 4GB。他们开源了一个向量索引,可容纳 10…

X AI KOLs Timeline · 2026-07-15 缓存

Google 开源了一个向量索引,将 31GB 的 AI 内存压缩到 4GB,可容纳 1000 万文档,搜索速度比 FAISS 更快,且无需训练或 GPU。

0 人收藏 0 人点赞
#memory-optimization

@brianbellx: 我在不对模型做任何改变的情况下,从 GLM-5.2 中移除了 423 GB。1,403 GB → 980 GB。753B 权重。逐比特精确。无需量化…

X AI KOLs Timeline · 2026-07-12 缓存

一种无需量化或重新训练即可从 GLM-5.2(753B 权重)中移除 423 GB 的技术,通过在 VRAM 中保持权重压缩状态实现逐比特精确压缩。

0 人收藏 0 人点赞
#memory-optimization

MosaicKV:使用动态二维KV缓存压缩服务长上下文LLM

arXiv cs.LG · 2026-07-02 缓存

MosaicKV引入了用于长上下文LLM服务的动态二维KV缓存压缩,实现了高达16倍的注意力加速和3倍的内存减少,且精度损失极小。

0 人收藏 0 人点赞
#memory-optimization

感知RoPE的KV缓存量化比特分配方法

arXiv cs.LG · 2026-06-24 缓存

提出Block-GTQ,一种感知RoPE的KV缓存量化比特分配方法,通过为高能量RoPE块分配更多比特,提升长上下文性能与内存效率。

0 人收藏 0 人点赞
#memory-optimization

@thtrkim: FlashAttention 的手动可视化深入讲解(使用 Excalidraw 绘制)https://winterrykim.github.io/blog/2026/training-lm-…

X AI KOLs Timeline · 2026-06-23 缓存

深入理解 FlashAttention 的可视化讲解,涵盖内存优化和算子融合,以实现语言模型训练中的高效注意力计算。

0 人收藏 0 人点赞
#memory-optimization

Qualcomm NPU 编译器的逆向工程

Lobsters Hottest · 2026-06-20 缓存

逆向工程 Qualcomm NPU 编译器揭示了未文档化的 VTCM 内存管理、基于 MILP 的布局、自动精度更改,以及一个用于边缘部署优化的隐藏分析模拟器(Hextimate)。

0 人收藏 0 人点赞
#memory-optimization

@FakeMaidenMaker: 炸裂!这个开源项目能给自部署的大模型推理大幅提速、还省显存 GitHub 狂揽 9.2K star,已经加入 PyTorch 基金会,NVIDIA 的 Dynamo 也集成了它。 GitHub:https://github.com/LMC…

X AI KOLs Timeline · 2026-06-18 缓存

LMCache 是一个 KV 缓存管理层,通过缓存并复用 KV cache 来加速大模型推理、降低显存消耗,已获 9.2K star 并加入 PyTorch 基金会,被 NVIDIA Dynamo 集成。

0 人收藏 0 人点赞
#memory-optimization

在sm120上使用NVFP4 KV缓存量化将使32GB VRAM系统变得非常强大

Reddit r/LocalLLaMA · 2026-06-18

在sm120上使用NVFP4 KV缓存量化显著提高了大语言模型的内存效率,使32GB VRAM系统在196k上下文大小下使用Qwen3.6-27B实现约60 tok/秒的推理速度。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈