Anthropic 发表了关于 GRAM 的研究:一种在权重层面精准移除 AI 模型危险知识的技术
摘要
Anthropic 发表了关于 GRAM 的研究,该技术旨在从 AI 模型的权重层面精确移除危险知识,从而推动 AI 安全的发展。
暂无内容
相似文章
@AnthropicAI: We’re pleased to have collaborated with AE Studio on this research. Read more here: https://anthropic.com/research/off-…
Anthropic and AE Studio propose GRAM (Gradient-Routed Auxiliary Modules), a method to surgically confine dual-use knowledge in AI models to removable modules, enabling selective access without retraining multiple models. Preliminary results show promise for more flexible safety controls.
2026年7月8日 对齐 一种针对AI模型中双重用途知识的关闭开关
Anthropic和AE Studio推出了GRAM方法,该方法将AI模型中的双重用途知识限制在可移除模块中,从而无需重新训练整个模型即可对危险能力进行精准控制。初步结果表明,这有望实现前沿模型的更安全部署。
Abliteration.ai 将移除AI安全防护作为一项业务
Abliteration.ai 是一家初创公司,致力于商业化移除AI模型的安全防护,提供对模型如GLM-5.3的无过滤访问,用于攻击性网络和红队工作,同时引发了关于AI安全和潜在滥用的讨论。
模块化预训练实现访问控制
本文介绍了GRAM(梯度路由辅助模块),一种模块化预训练方法,通过选择性添加和消融模块来限制AI模型的双重用途能力,实现访问控制,并显示出相较于数据过滤的成本降低。
Anthropic:AI模型能否评判AI安全研究提案?
Anthropic推出了TASTE,一个用于评估AI模型判断AI安全研究提案能力的基准测试,发现像Fable 5这样的模型表现不如人类研究人员。