Anthropic 发表了关于 GRAM 的研究:一种在权重层面精准移除 AI 模型危险知识的技术

Reddit r/artificial 论文

摘要

Anthropic 发表了关于 GRAM 的研究,该技术旨在从 AI 模型的权重层面精确移除危险知识,从而推动 AI 安全的发展。

暂无内容
查看原文

相似文章

Abliteration.ai 将移除AI安全防护作为一项业务

TechCrunch AI

Abliteration.ai 是一家初创公司,致力于商业化移除AI模型的安全防护,提供对模型如GLM-5.3的无过滤访问,用于攻击性网络和红队工作,同时引发了关于AI安全和潜在滥用的讨论。

模块化预训练实现访问控制

arXiv cs.LG

本文介绍了GRAM(梯度路由辅助模块),一种模块化预训练方法,通过选择性添加和消融模块来限制AI模型的双重用途能力,实现访问控制,并显示出相较于数据过滤的成本降低。