memory-efficiency

标签

Cards List
#memory-efficiency

GEM-KMeans:GPU 优化下大规模、高内存效率且精准的聚类算法

arXiv cs.LG ↗ · 11小时前 缓存

GEM-KMeans 提出了一种谱归一化、高内存效率的 K-means 聚类非线性回归(NLR)公式,将更新融合进单次矩阵乘法的收尾阶段(epilogue),使 GPU 高带宽存储只需保留一个因子,同时在超大规模数据上保持聚类精度。

0 人收藏 0 人点赞
#memory-efficiency

Pruned CTC:内存高效的大词汇量自动语音识别训练

Hugging Face Daily Papers ↗ · 3天前 缓存

本文介绍了Pruned CTC,这是一种通过限制对齐计算来降低大词汇量自动语音识别中连接时序分类训练内存使用的方法,证明了其与全词汇量CTC的等价性,并展示了在离线和流式设置下与LLM适配的强大性能。

0 人收藏 0 人点赞
#memory-efficiency

@hooshaaii: 当大型语言模型的KV缓存超出内存限制时会崩溃。论文《Efficient Streaming Language Models with Attention Sinks》...

X AI KOLs Timeline ↗ · 6天前 缓存

论文介绍了StreamingLLM,这是一个使用注意力汇聚(attention sinks)的框架,使大型语言模型能够处理无限序列长度而无需微调,从而提高流式应用的效率。

0 人收藏 0 人点赞
#memory-efficiency

Flash-dLLM:IO感知的KV缓存和并行解码,用于快速、内存高效的扩散LLMs

Hugging Face Daily Papers ↗ · 2026-09-22 缓存

Flash-dLLM是一个用于扩散LLMs的免训练推理加速框架,它通过IO感知的KV缓存和并行解码来实现显著的加速和内存效率提升。

0 人收藏 0 人点赞
#memory-efficiency

SGD-KV: 摘要引导的KV缓存压缩

arXiv cs.CL ↗ · 2026-09-04 缓存

SGD-KV是一个框架,利用摘要来指导大型语言模型中的KV缓存压缩,在上下文长度高达100万token时,将内存使用量减少高达75%,同时在长上下文基准测试中实现最先进的性能。

0 人收藏 0 人点赞
#memory-efficiency

PuzzleKV:基于页面的低秩分解用于KV缓存压缩

arXiv cs.LG ↗ · 2026-08-26 缓存

PuzzleKV是一种无需训练的方法,用于压缩大语言模型中的键值缓存,采用基于页面的低秩分解,以约60%的存储实现超过96%的性能。

0 人收藏 0 人点赞
#memory-efficiency

Prefix Sliding:实现高效测试时缩放

Hugging Face Daily Papers ↗ · 2026-08-26 缓存

Prefix Sliding 通过丢弃不重要的中间令牌来降低长推理过程中的内存成本,从而在不重新训练的情况下实现高效的测试时缩放,在现有模型中最高可提速3倍。

0 人收藏 0 人点赞
#memory-efficiency

Gated Recurrent Transformers:通过循环调制实现Transformer中的表达性深度

Hugging Face Daily Papers ↗ · 2026-08-25 缓存

本文介绍了Gated Recurrent Transformer模型,该模型通过自适应更新门在深度上重用共享核心,以更少的参数和更低的内存实现与更深模型相当或更好的质量。

0 人收藏 0 人点赞
#memory-efficiency

Q-Interference:内存高效的相位感知量子启发注意力机制

arXiv cs.CL ↗ · 2026-08-19 缓存

本文提出Q-Interference,一种用于GPT模型的内存高效量子启发注意力机制,该机制使用相位感知评分和精确三角因式分解,以改善令牌交互而不增加内存开销。

0 人收藏 0 人点赞
#memory-efficiency

p-自旋玻璃网络的高效单批次持续学习

arXiv cs.LG ↗ · 2026-08-18 缓存

介绍p-Spin Glass Network——一种全新的序列模型架构,它实现了内存高效、样本高效以及单批次稳定性,从而支持持续学习与边缘AI应用。

0 人收藏 0 人点赞
#memory-efficiency

前向传播领域适应(无跨层反向传播)

arXiv cs.LG ↗ · 2026-08-18 缓存

仅前向传播的MLP训练(FPO)在无需反向传播的情况下适应大型语言模型,实现2.7–3.2倍的吞吐量提升,同时峰值内存减少40%,并保持基准性能。

0 人收藏 0 人点赞
#memory-efficiency

RecurrentGPT:通过递归调制在Transformer中实现表达性深度

arXiv cs.CL ↗ · 2026-08-18 缓存

RecurrentGPT引入了一种递归深度Transformer,它使用门控调制来迭代重用共享层,与标准Transformer相比,以更少的参数实现了竞争性的准确性并提高了内存效率。

0 人收藏 0 人点赞
#memory-efficiency

当模型学习时(4分钟阅读)

TLDR AI ↗ · 2026-08-18 缓存

本文解释了测试时训练,即AI模型在推理过程中适应以提高个性化并减少内存使用,但代价是增加每用户计算量。文章讨论了对大规模服务模型的影响,以及在长上下文和用户并发之间的平衡。

0 人收藏 0 人点赞
#memory-efficiency

预测随机低维重参数化何时能训练神经网络

arXiv cs.LG ↗ · 2026-08-14 缓存

本文分析了随机低维重参数化何时能训练神经网络,推导出随机切片残差的取向分辨主公式,并引入RaMaN——一个可扩展框架,能以极低内存成本预测所需潜在维度。

0 人收藏 0 人点赞
#memory-efficiency

面向长时程工具使用智能体任务的高效强化学习

arXiv cs.LG ↗ · 2026-08-12 缓存

本文介绍了 SinkFlex-RL,一个用于长时程工具使用智能体任务中内存可行的强化学习的模块化训练系统。它结合了兼容 Gymnasium 的环境封装、基于 GRPO 的策略优化,以及 sink 感知的 FlexAttention 路径,在 4096 个 token 时峰值显存降低 19.7%,并能在 eager attention 内存溢出的情况下支持 8192 个 token 的运行。

0 人收藏 0 人点赞
#memory-efficiency

@PrajwalTomar_:停一下。在你添加另一个AI代理之前,请先阅读。人们现在并行运行20个编码代理。二十个。而且工具…

X AI KOLs Timeline ↗ · 2026-08-11 缓存

该推文认为,并行运行过多AI编码代理会降低代码库质量,并提倡使用少数几个专门代理的结构化设置。它还提到了Jcode的发布,这是一个开源代理,声称内存效率提高20倍。

0 人收藏 0 人点赞
#memory-efficiency

QEvict: Recoverable Quantized KV Eviction for Attention-Drift-Robust Long-Context Decoding

arXiv cs.LG ↗ · 2026-08-07 缓存

This paper introduces QEvict, a KV-cache management scheme for LLMs that uses recoverable quantized eviction to handle attention drift during long-context decoding, improving memory efficiency while preserving important historical context.

0 人收藏 0 人点赞
#memory-efficiency

MM-ShiftKV: 解码感知的预填充阶段KV选择用于多模态大语言模型

arXiv cs.AI ↗ · 2026-07-28 缓存

MM-ShiftKV是一种无需训练的方法,通过在预填充阶段近似解码时的查询行为来改进多模态大语言模型的KV缓存选择,减少内存占用同时保持性能。

0 人收藏 0 人点赞
#memory-efficiency

@liambraus: CLAUDE CODE 启动需要 3.4 秒,而这个只需 14 毫秒。一位独立开发者刚刚构建了自己的…

X AI KOLs Timeline ↗ · 2026-07-24 缓存

一位独立开发者用 Rust 构建了一个代码代理框架,启动速度比 Claude Code 快 245 倍(14 毫秒 vs 3.4 秒),内存消耗最多减少 20 倍,在 GitHub 上获得了 10.4k 星标。

0 人收藏 0 人点赞
#memory-efficiency

面向高效大语言模型服务:系统感知KV缓存优化综述

arXiv cs.LG ↗ · 2026-07-10 缓存

一篇系统综述,回顾系统感知的KV缓存优化技术,用于高效的大语言模型服务,将现有工作组织为执行/调度、放置/迁移和表示/保留三个维度。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈