@jiqizhixin: NVIDIA 新成果!你可以在不扰乱模型已有知识的前提下编辑其压缩记忆!推出 Gated DeltaNe…

X AI KOLs Timeline 论文

摘要

NVIDIA 推出 Gated DeltaNet-2,一种在不导致灾难性遗忘的前提下编辑模型压缩记忆的方法,使用独立的门控机制分别执行擦除和写入操作。该方法在语言建模和长上下文任务上优于 Mamba-2、Mamba-3 等现有模型。

NVIDIA 新成果! 你可以在不扰乱模型已有知识的前提下编辑其压缩记忆! 推出 Gated DeltaNet-2。 它将线性注意力中的擦除和写入操作分离,使用两个独立门控——一个用于遗忘旧信息,另一个用于添加新信息。 在语言建模、常识推理和检索任务中均优于 Mamba-2、Gated DeltaNet、KDA 和 Mamba-3,尤其是在长上下文“大海捞针”基准测试中表现突出。
查看原文
查看缓存全文

缓存时间: 2026/05/22 09:48

新来自 NVIDIA!

你可以编辑模型的压缩记忆,而不会破坏它已经学到的内容!

欢迎 Gated DeltaNet-2。

它在线性注意力中将擦除和写入操作分离,使用两个独立的门——一个用于遗忘旧信息,另一个用于添加新信息。

在语言建模、常识推理和检索任务中,性能优于 Mamba-2、Gated DeltaNet、KDA 和 Mamba-3——尤其在长上下文“大海捞针”基准测试中表现突出。

相似文章

Δ-Mem:大型语言模型的高效在线记忆

Hacker News Top

提出 delta-Mem,一种轻量级在线记忆机制,利用紧凑状态矩阵并通过增量规则学习进行更新,以提升冻结大型语言模型的长上下文性能,无需全量微调或上下文扩展。

δ-mem:大型语言模型的高效在线记忆机制

Hugging Face Daily Papers

本文介绍了 δ-mem,这是一种轻量级的记忆机制,通过为冻结的注意力骨干网络增加一个紧凑的关联记忆状态来增强大型语言模型。实验表明,该机制在计算开销极小的情况下,在记忆密集型基准测试中实现了性能提升。