标签
GEM-KMeans 提出了一种谱归一化、高内存效率的 K-means 聚类非线性回归(NLR)公式,将更新融合进单次矩阵乘法的收尾阶段(epilogue),使 GPU 高带宽存储只需保留一个因子,同时在超大规模数据上保持聚类精度。
本文介绍了Pruned CTC,这是一种通过限制对齐计算来降低大词汇量自动语音识别中连接时序分类训练内存使用的方法,证明了其与全词汇量CTC的等价性,并展示了在离线和流式设置下与LLM适配的强大性能。
论文介绍了StreamingLLM,这是一个使用注意力汇聚(attention sinks)的框架,使大型语言模型能够处理无限序列长度而无需微调,从而提高流式应用的效率。
Flash-dLLM是一个用于扩散LLMs的免训练推理加速框架,它通过IO感知的KV缓存和并行解码来实现显著的加速和内存效率提升。
SGD-KV是一个框架,利用摘要来指导大型语言模型中的KV缓存压缩,在上下文长度高达100万token时,将内存使用量减少高达75%,同时在长上下文基准测试中实现最先进的性能。
PuzzleKV是一种无需训练的方法,用于压缩大语言模型中的键值缓存,采用基于页面的低秩分解,以约60%的存储实现超过96%的性能。
Prefix Sliding 通过丢弃不重要的中间令牌来降低长推理过程中的内存成本,从而在不重新训练的情况下实现高效的测试时缩放,在现有模型中最高可提速3倍。
本文介绍了Gated Recurrent Transformer模型,该模型通过自适应更新门在深度上重用共享核心,以更少的参数和更低的内存实现与更深模型相当或更好的质量。
本文提出Q-Interference,一种用于GPT模型的内存高效量子启发注意力机制,该机制使用相位感知评分和精确三角因式分解,以改善令牌交互而不增加内存开销。
介绍p-Spin Glass Network——一种全新的序列模型架构,它实现了内存高效、样本高效以及单批次稳定性,从而支持持续学习与边缘AI应用。
仅前向传播的MLP训练(FPO)在无需反向传播的情况下适应大型语言模型,实现2.7–3.2倍的吞吐量提升,同时峰值内存减少40%,并保持基准性能。
RecurrentGPT引入了一种递归深度Transformer,它使用门控调制来迭代重用共享层,与标准Transformer相比,以更少的参数实现了竞争性的准确性并提高了内存效率。
本文解释了测试时训练,即AI模型在推理过程中适应以提高个性化并减少内存使用,但代价是增加每用户计算量。文章讨论了对大规模服务模型的影响,以及在长上下文和用户并发之间的平衡。
本文分析了随机低维重参数化何时能训练神经网络,推导出随机切片残差的取向分辨主公式,并引入RaMaN——一个可扩展框架,能以极低内存成本预测所需潜在维度。
本文介绍了 SinkFlex-RL,一个用于长时程工具使用智能体任务中内存可行的强化学习的模块化训练系统。它结合了兼容 Gymnasium 的环境封装、基于 GRPO 的策略优化,以及 sink 感知的 FlexAttention 路径,在 4096 个 token 时峰值显存降低 19.7%,并能在 eager attention 内存溢出的情况下支持 8192 个 token 的运行。
该推文认为,并行运行过多AI编码代理会降低代码库质量,并提倡使用少数几个专门代理的结构化设置。它还提到了Jcode的发布,这是一个开源代理,声称内存效率提高20倍。
This paper introduces QEvict, a KV-cache management scheme for LLMs that uses recoverable quantized eviction to handle attention drift during long-context decoding, improving memory efficiency while preserving important historical context.
MM-ShiftKV是一种无需训练的方法,通过在预填充阶段近似解码时的查询行为来改进多模态大语言模型的KV缓存选择,减少内存占用同时保持性能。
一位独立开发者用 Rust 构建了一个代码代理框架,启动速度比 Claude Code 快 245 倍(14 毫秒 vs 3.4 秒),内存消耗最多减少 20 倍,在 GitHub 上获得了 10.4k 星标。
一篇系统综述,回顾系统感知的KV缓存优化技术,用于高效的大语言模型服务,将现有工作组织为执行/调度、放置/迁移和表示/保留三个维度。