@jiqizhixin: NVIDIA 新成果!你可以在不扰乱模型已有知识的前提下编辑其压缩记忆!推出 Gated DeltaNe…
摘要
NVIDIA 推出 Gated DeltaNet-2,一种在不导致灾难性遗忘的前提下编辑模型压缩记忆的方法,使用独立的门控机制分别执行擦除和写入操作。该方法在语言建模和长上下文任务上优于 Mamba-2、Mamba-3 等现有模型。
查看缓存全文
缓存时间: 2026/05/22 09:48
新来自 NVIDIA!
你可以编辑模型的压缩记忆,而不会破坏它已经学到的内容!
欢迎 Gated DeltaNet-2。
它在线性注意力中将擦除和写入操作分离,使用两个独立的门——一个用于遗忘旧信息,另一个用于添加新信息。
在语言建模、常识推理和检索任务中,性能优于 Mamba-2、Gated DeltaNet、KDA 和 Mamba-3——尤其在长上下文“大海捞针”基准测试中表现突出。
相似文章
Sparse Delta Memory:通过稀疏性扩展线性RNN的状态容量
Sparse Delta Memory 通过稀疏寻址扩展了门控线性RNN,显著增加了隐藏状态容量,从而在保持计算效率的同时改进了长上下文学习和检索。
Δ-Mem:大型语言模型的高效在线记忆
提出 delta-Mem,一种轻量级在线记忆机制,利用紧凑状态矩阵并通过增量规则学习进行更新,以提升冻结大型语言模型的长上下文性能,无需全量微调或上下文扩展。
@che_shr_cat: 1/ 我们一直误解了GPU内存的使用方式。如果GPU根本不需要存储你的模型呢?MegaTrain 实现了…
MegaTrain 通过将 VRAM 视为瞬时无状态缓存,反转内存层次结构,在单张 GPU 上实现了 100B 以上大语言模型的全精度训练。
δ-mem:大型语言模型的高效在线记忆机制
本文介绍了 δ-mem,这是一种轻量级的记忆机制,通过为冻结的注意力骨干网络增加一个紧凑的关联记忆状态来增强大型语言模型。实验表明,该机制在计算开销极小的情况下,在记忆密集型基准测试中实现了性能提升。
@jiqizhixin: 如果AI的记忆不必随着每多一句话而膨胀呢?牛津大学、Technion、AITHYRA 等…
介绍了KV-Compression Aware Training (KV-CAT) 方法,该方法鼓励Transformer在训练过程中学习可压缩的键值缓存,在不牺牲性能的情况下提高长上下文任务的记忆效率。