memory-efficiency

标签

Cards List
#memory-efficiency

PGD-NO:一种具有预计算几何分解的神经算子,用于三维百万级物理模拟

arXiv cs.LG ↗ · 2026-07-10 缓存

PGD-NO是一种预计算几何分解的神经算子,能够实现线性内存可扩展性,从而在超过1000万个节点的网格上实现高保真物理模拟,并克服单节点内存瓶颈。

0 人收藏 0 人点赞
#memory-efficiency

DepthWeave-KV:用于长上下文KV缓存压缩的令牌自适应跨层残差分解方法

arXiv cs.AI ↗ · 2026-07-08 缓存

DepthWeave-KV 是一种令牌自适应跨层残差分解方法,用于在长上下文Transformer推理中压缩KV缓存。该方法在64K上下文下实现8.3倍内存缩减和72.8令牌/秒的吞吐量,同时在各项基准测试中保持了接近完整缓存的任务质量。

0 人收藏 0 人点赞
#memory-efficiency

FreqDepthKV: 频率引导的深度共享实现长上下文LLM推理中鲁棒的KV缓存压缩

arXiv cs.AI ↗ · 2026-07-08 缓存

提出FreqDepthKV,一种用于长上下文LLM推理中KV缓存压缩的频率引导深度共享方法。该方法将相邻层的KV状态分解为共享的低频成分和稀疏的高频残差,在保证基准测试精度的同时提升内存效率和吞吐量。

0 人收藏 0 人点赞
#memory-efficiency

@MaxForAI: 我同意Andrew的观点,内存效率方面即将迎来重大突破,这个事情其实是Infra这边努力了很久的方向。 并且已经有了很大的成果,比如说:缓存命中。 DeepSeek早在硬盘KV Cache落地后,就把缓存命中的输入价格砍到未命中价格的1/…

X AI KOLs Timeline ↗ · 2026-07-01 缓存

技术专家讨论内存效率即将迎来的重大突破,提及DeepSeek通过KV缓存优化已将缓存命中输入价格降至未命中价格的1/10到1/50,并透露OpenAI工程师利用多项优化技术将推理成本削减一半以上。

0 人收藏 0 人点赞
#memory-efficiency

WAL-RUS:使用Rust重写的WAL-G PostgreSQL备份工具

Hacker News Top ↗ · 2026-06-27 缓存

ClickHouse Cloud 宣布推出 WAL-RUS,这是一个开源的、使用 Rust 重写的 WAL-G PostgreSQL 备份工具,专注于可预测的内存使用和 WAL-G 兼容性。

0 人收藏 0 人点赞
#memory-efficiency

SHAPE: 面向稀疏混合专家大语言模型的联盟感知专家剪枝

arXiv cs.LG ↗ · 2026-06-10 缓存

SHAPE提出了一种面向稀疏MoE大语言模型的联盟感知专家剪枝框架,该框架利用路由轨迹上的Shapley式归因来识别关键专家,在20-40%剪枝率下实现了有竞争力的准确率,并降低了GPU内存占用。

0 人收藏 0 人点赞
#memory-efficiency

@HuggingPapers: 微软研究院推出Mirage潜在空间记忆,直接将3D场景存储为潜在标记,跳过了昂贵的…

X AI KOLs Following ↗ · 2026-06-09 缓存

微软研究院推出Mirage,一种潜在空间记忆,直接将3D场景存储为潜在标记,实现视频生成速度提升高达10.57倍,内存使用降低55倍,并达到最先进的一致性。

0 人收藏 0 人点赞
#memory-efficiency

FlashMemory-DeepSeek-V4:通过前瞻稀疏注意力实现闪电索引超长上下文

Hugging Face Daily Papers ↗ · 2026-06-08 缓存

提出在DeepSeek-V4上结合神经记忆索引器的前瞻稀疏注意力,将GPU内存使用降至全上下文基线的约13.5%,同时保持或略微提升准确率。

0 人收藏 0 人点赞
#memory-efficiency

proveKV – 诚实的36倍无损(vs f32,18倍 vs fp16)KV缓存压缩用于LLM(零PPL回归)

Reddit r/LocalLLaMA ↗ · 2026-06-05

一个开源仓库proveKV展示了一种可复现的KV缓存压缩技术,在SmolLM2-1.7B上实现了36倍无损(vs f32)和68倍有损内存减少,且PPL回归为零,包括Rust示例和审计管道。

0 人收藏 0 人点赞
#memory-efficiency

dMoE: 具有可学习块级专家的dLLMs

Hugging Face Daily Papers ↗ · 2026-05-29 缓存

本文提出了dMoE,一种用于扩散大语言模型的块级混合专家框架,该框架将词元级专家分布聚合成块级路由,在保持性能的同时减少激活的专家数量和内存使用。

0 人收藏 0 人点赞
#memory-efficiency

十多年来,我们一直认为端到端反向传播是训练深度网络的唯一方法(1分钟阅读)

TLDR AI ↗ · 2026-05-29 缓存

Sakana AI 提出了 DiffusionBlocks,一种通过将前向传播解释为扩散去噪来分块训练神经网络的方法,与传统端到端反向传播相比,显著降低了内存需求。

0 人收藏 0 人点赞
#memory-efficiency

重新参数化Shampoo和SOAP以支持子空间基更新和BFloat16存储

arXiv cs.LG ↗ · 2026-05-27 缓存

本文提出了一种对基于Shampoo的优化方法(如KL-Shampoo和SOAP)中预条件器的重新参数化,以支持BFloat16存储,并通过在子空间中仅通过QR分解更新部分基来减少计算开销,从而使这些方法在内存和时间上更高效。

0 人收藏 0 人点赞
#memory-efficiency

量化键偷走注意力:视频扩散中KV缓存压缩的偏差校正

arXiv cs.LG ↗ · 2026-05-27 缓存

本文指出,在分块自回归视频扩散的KV缓存压缩中,对键进行量化会导致注意力权重出现偏差,并提出了一种每注意力分数校正方法,该方法以可忽略的开销消除偏差,在INT2量化下恢复接近BF16的视频质量。

0 人收藏 0 人点赞
#memory-efficiency

CONF-KV: 置信度感知的KV缓存淘汰与混合精度存储用于长视界大语言模型

Hugging Face Daily Papers ↗ · 2026-05-24 缓存

CONF-KV 是一种KV缓存管理系统,利用模型不确定性动态调整缓存保留策略,从而提升长上下文大语言模型推理的内存效率,同时将困惑度控制在1.5-2.1个点以内。

0 人收藏 0 人点赞
#memory-efficiency

自剪枝键值注意力:通过预测未来效用决定何时写入

arXiv cs.LG ↗ · 2026-05-15 缓存

提出了自剪枝键值注意力(SP-KV),一种通过学习预测键值对未来效用的机制,动态剪枝KV缓存,将内存使用和解码速度提升3-10倍,且性能下降极小。模型和效用预测器通过下一词元预测进行端到端联合训练。

0 人收藏 0 人点赞
#memory-efficiency

价值感知KV缓存淘汰何时有效?一种针对非单调缓存压缩的固定契约诊断方法

arXiv cs.LG ↗ · 2026-05-12 缓存

本文介绍了一种固定契约诊断工具,用于分析KV缓存压缩方法在长上下文LLM推理中成功或失败的原因。文章确定了三种故障模式——遗漏证据、对无关token进行评分以及破坏相关证据——并在LongBench和NeedleBench上对这些模式进行了评估。

0 人收藏 0 人点赞
#memory-efficiency

ReST-KV:基于逐层输出重构与时空平滑的鲁棒 KV Cache 驱逐方法

arXiv cs.CL ↗ · 2026-05-12 缓存

本文介绍了 ReST-KV,一种用于大型语言模型的新型鲁棒 KV Cache 驱逐方法。该方法利用逐层输出重构与时空平滑技术来提升效率,显著降低了解码延迟,并在 LongBench 和 RULER 等长上下文基准测试中超越了现有的最先进基线模型。

0 人收藏 0 人点赞
#memory-efficiency

如何在强化学习后训练中压缩 KV 缓存?用于内存高效对齐的阴影掩码蒸馏

arXiv cs.LG ↗ · 2026-05-11 缓存

本文提出了阴影掩码蒸馏(SMD),旨在解决大语言模型在强化学习后训练中因 KV 缓存压缩而导致的离策略偏差。该方法引入了一种机制,确保在策略上的对齐,并提高长上下文推理任务的内存效率。

0 人收藏 0 人点赞
#memory-efficiency

OjaKV: 上下文感知的在线低秩KV缓存压缩

arXiv cs.CL ↗ · 2026-04-20 缓存

OjaKV 引入了一种上下文感知的在线低秩KV缓存压缩框架,该框架利用混合存储策略和Oja算法进行增量子空间自适应,以减少长上下文大语言模型推理中的GPU内存瓶颈,且无需模型微调。

0 人收藏 0 人点赞
#memory-efficiency

Ulysses 序列并行:百万Token上下文训练

Hugging Face Blog ↗ · 2026-03-09 缓存

Ulysses 序列并行是一种用于训练具有百万Token上下文的大语言模型的技术,通过将序列块分布在多个GPU上来降低内存需求,实现高效的长上下文训练。它与HuggingFace Accelerate、Transformers Trainer和TRL集成,支持Flash Attention和DeepSpeed ZeRO。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈