model-editing

标签

Cards List
#model-editing

Anthropic 发表了关于 GRAM 的研究:一种在权重层面精准移除 AI 模型危险知识的技术

Reddit r/artificial · 2026-07-09

Anthropic 发表了关于 GRAM 的研究,该技术旨在从 AI 模型的权重层面精确移除危险知识,从而推动 AI 安全的发展。

0 人收藏 0 人点赞
#model-editing

基于 Process Sidecars 的可撤销学习状态

arXiv cs.LG · 2026-07-01 缓存

本文介绍了 Process Sidecars,一种用于在安全训练后从语言模型中撤销学习状态的双系数编辑族,实现了二阶精度,并在多个模型的实验中优于朴素任务算术。

0 人收藏 0 人点赞
#model-editing

BrainSurgery: 可重现且可靠的声明式权重操作,用于模型编辑与升级

Hugging Face Daily Papers · 2026-06-08 缓存

BrainSurgery 是一个用于对神经网络检查点进行可重现且声明式权重操作的工具,通过内置验证的 YAML 计划实现模型编辑与升级。

0 人收藏 0 人点赞
#model-editing

@jiqizhixin: NVIDIA 新成果!你可以在不扰乱模型已有知识的前提下编辑其压缩记忆!推出 Gated DeltaNe…

X AI KOLs Timeline · 2026-05-22 缓存

NVIDIA 推出 Gated DeltaNet-2,一种在不导致灾难性遗忘的前提下编辑模型压缩记忆的方法,使用独立的门控机制分别执行擦除和写入操作。该方法在语言建模和长上下文任务上优于 Mamba-2、Mamba-3 等现有模型。

0 人收藏 0 人点赞
#model-editing

模态解耦的在线递归编辑

arXiv cs.LG · 2026-05-21 缓存

提出M-ORE,一种模态解耦的在线递归编辑器,用于多模态大语言模型的终身适应,解决跨模态冲突和编辑间干扰,且每次编辑开销恒定。

0 人收藏 0 人点赞
#model-editing

HoReN:用于大规模序列模型编辑的归一化Hopfield检索

arXiv cs.LG · 2026-05-12 缓存

本文介绍了HoReN,这是一种参数保留的模型编辑方法,使用归一化Hopfield检索来处理对大型语言模型的大规模序列更新。它解决了知识积累和路由挑战的问题,在50,000次序列编辑上展示了稳定的性能,而先前的方法在这种情况下性能会退化。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈