标签
Anthropic 发表了关于 GRAM 的研究,该技术旨在从 AI 模型的权重层面精确移除危险知识,从而推动 AI 安全的发展。
本文介绍了 Process Sidecars,一种用于在安全训练后从语言模型中撤销学习状态的双系数编辑族,实现了二阶精度,并在多个模型的实验中优于朴素任务算术。
BrainSurgery 是一个用于对神经网络检查点进行可重现且声明式权重操作的工具,通过内置验证的 YAML 计划实现模型编辑与升级。
NVIDIA 推出 Gated DeltaNet-2,一种在不导致灾难性遗忘的前提下编辑模型压缩记忆的方法,使用独立的门控机制分别执行擦除和写入操作。该方法在语言建模和长上下文任务上优于 Mamba-2、Mamba-3 等现有模型。
提出M-ORE,一种模态解耦的在线递归编辑器,用于多模态大语言模型的终身适应,解决跨模态冲突和编辑间干扰,且每次编辑开销恒定。
本文介绍了HoReN,这是一种参数保留的模型编辑方法,使用归一化Hopfield检索来处理对大型语言模型的大规模序列更新。它解决了知识积累和路由挑战的问题,在50,000次序列编辑上展示了稳定的性能,而先前的方法在这种情况下性能会退化。