2026年7月8日 对齐 一种针对AI模型中双重用途知识的关闭开关

Anthropic Research 论文

摘要

Anthropic和AE Studio推出了GRAM方法,该方法将AI模型中的双重用途知识限制在可移除模块中,从而无需重新训练整个模型即可对危险能力进行精准控制。初步结果表明,这有望实现前沿模型的更安全部署。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/07/09 07:48

# AI 模型中双重用途知识的开关 来源:https://www.anthropic.com/research/off-switch-dual-use *本文介绍的是由AE Studio (https://ae.studio/alignment)与Anthropic合作开展的研究。* 前沿AI模型本质上是一个巨大的知识存储库。其中部分知识具有*双重用途*,即既可造福也可作恶。例如,网络安全知识可以用于修补关键安全漏洞,也可以被用来利用这些漏洞;病毒学知识可以帮助研究人员开发疫苗,也可以被恶意行为者设计出致命病原体。理想情况下,我们希望能够平衡三个独立目标:第一,以尽可能精准的方式限制对双重用途能力的访问;第二,允许可信用户出于有益目的使用这些能力;第三,同时不影响模型在其他任何任务上的表现。 当前的防护措施并不完美。我们训练模型拒绝有害请求,并使用分类器对输入和输出进行危险内容筛查。这些防护层能抵御危险输出——但不会改变底层模型中存储的知识。尽管有这些防护,一个足够坚决的攻击者仍可能尝试越狱 (https://www.anthropic.com/news/fable-safeguards-jailbreak-framework)模型,突破防御以获取双重用途知识。 一种更稳健的防滥用方法是对模型的知识进行控制。我们此前已经探索过这一点:在早期工作中,我们从预训练数据中过滤了关于化学、生物、放射性和核武器的信息 (https://alignment.anthropic.com/2025/pretraining-data-filtering/),后来证明双重用途知识可以被限制在模型权重的一个可移除切片中 (https://alignment.anthropic.com/2025/selective-gradient-masking/)。但过滤是一种粗糙的工具。它只能产生一个具有固定能力集的模型。使用过滤方法,如果你想要一个*能够*讨论高级病毒学的模型版本(例如用于经过审查的生物安全实验室)和另一个不能讨论的版本,就必须训练两个独立的模型。特别是对于前沿模型(它们规模庞大且训练成本极高)而言,对开发者来说成本将是难以承受的。 在与AE Studio合作者共同开展的最新研究 (https://alignment.anthropic.com/2026/modular-pretraining/)中,我们探索了一种新方法,该方法可以带来训练多个分别过滤的模型的好处,但只需要训练一个模型的成本。我们称之为GRAM(梯度路由辅助模块,Gradient-Routed Auxiliary Modules)。请注意,本文展示的实验结果是初步的——GRAM尚未应用于Anthropic的任何生产模型,我们也不确定将来是否会应用。 ## GRAM的工作原理 GRAM的核心思想是:为模型赋予每个双重用途知识类别专用的可移除隔间,并且在从双重用途数据学习时只更新这些隔间。 具体来说,GRAM在标准Transformer(大型语言模型所基于的神经网络架构)的每一层中添加额外的神经元。这些神经元被分为若干组(即“模块”),每组对应一个双重用途类别。在训练过程中,当模型遇到通用文本时,它像往常一样学习。但当遇到来自双重用途类别的文本(例如病毒学)时,规则会变化:模型可以*使用*其通用知识进行预测,但只有病毒学模块被允许从该文本中*学习*。通用权重视被暂时冻结。¹ 结果是,病毒学知识积累在病毒学模块中,而不是扩散到整个网络。训练完成后,该模块可以简单地被删除,相应的能力也随之消失。或者,在需要病毒学知识的可信部署场景中,该模块可以保留在原位。知识可以根据所需的部署类型进行高度定制:在我们的实验中,我们定义了四个双重用途类别,因此一次使用GRAM的训练运行可以生成一个能以十六种不同方式配置的模型(每个类别“开启”或“关闭”)。 ## 测试GRAM 我们在三个日益真实的场景中测试了GRAM。 首先,在一个按主题标记的儿童故事合成数据集上,一个小型GRAM模型可以被重新配置以“遗忘”任何选定主题,并且每种配置的表现几乎与单独以该主题被过滤掉的数据从头训练的模型相同。也就是说,以训练单个模型的成本,我们获得了通常需要在不同数据集上进行多次训练才能达到的结果。 其次,我们训练了一个更大的模型,使用了包含网络文本、代码和科学论文的真实混合数据,涵盖四个双重用途领域:病毒学、网络安全、核物理以及一种小众编程语言(作为专业双重用途代码的代理)。每个双重用途领域的能力被路由到其专属模块。删除一个模块,相应能力的消除效果几乎与从未在该数据上训练过一样。值得注意的是,我们发现这种删除并没有降低通用性能。 我们还测试了攻击者是否可以通过在少量恶意数据上训练来恢复被移除的知识;GRAM抵抗这种攻击的效果与数据过滤相当。相比之下,一种在训练后应用的“反学习”技术只是*压制*了知识——通过少量微调就能轻松恢复。 第三,我们在七个模型规模(从5000万参数到50亿参数)上进行了实验。GRAM在所有规模上都与数据过滤的表现相匹配,并且随着模型变大,“模块开启”与“模块关闭”之间的差距也变得更宽。在计算成本方面,尝试绕过我们的防护措施随着规模扩大而变得更加困难和昂贵。 ## 结论 随着AI公司训练出能力更强的模型,限制对双重用途能力的访问需求也将增加。如今,公司通过分类器和拒绝训练来限制访问。然而,这些防护措施很难在不降低对无害请求表现的情况下变得稳健。像GRAM这样的方法提供了一条实现更稳健访问控制的潜在路径。 这仍是早期研究,存在明显的局限性。我们尚未在前沿规模或生产训练流程中测试GRAM。(如上所述,它尚未应用于我们任何Claude模型。)我们的评估以预测下一个token的能力来量化性能,而非真实下游任务的表现。此外,还有一个更深层次的开放问题同样适用于数据过滤和GRAM这类方法:某些双重用途的能力可能与通用知识纠缠得过于紧密,以至于没有方法能够干净地将它们分离。 *关于我们实验的更多细节,请阅读我们在对齐科学博客上的文章 (https://alignment.anthropic.com/2026/modular-pretraining/)。* #### 脚注 1. 一个技术细节是,在学习通用文本时,病毒学模块有时也会被打开。我们发现这有助于模块之间更有效地“协同工作”。 ## 相关内容 ### 语言模型中的全局工作空间 新的可解释性研究揭示了Claude中一个涌现的心理工作空间,该空间承载着不体现在模型输出中的内部想法。 阅读更多 (https://www.anthropic.com/research/global-workspace) ### Anthropic经济指数报告:节奏 在我们的最新经济指数报告中,我们首次按小时采样,提出问题:人们何时使用Claude?他们用它来产出什么?以及他们如何看待AI对其工作的影响? 阅读更多 (https://www.anthropic.com/research/economic-index-june-2026-report) ### 项目Fetch:第二阶段 我们报告了最新测试结果,测试Claude是否能帮助Anthropic员工完成复杂的机器人任务。我们发现,在不到一年前参与者完成的所有任务中,无需人类协助的Claude Opus 4.7比最快的人类团队快约20倍。 阅读更多 (https://www.anthropic.com/research/project-fetch-phase-two)

相似文章

模块化预训练实现访问控制

arXiv cs.LG

本文介绍了GRAM(梯度路由辅助模块),一种模块化预训练方法,通过选择性添加和消融模块来限制AI模型的双重用途能力,实现访问控制,并显示出相较于数据过滤的成本降低。

2026年5月19日 公告:拓展前沿AI对话

Anthropic News

Anthropic宣布将与宗教、哲学和文化团体开展一系列对话,以拓宽构建安全且有益AI的视角。这些对话旨在为像Claude这样的AI系统的道德形成提供参考。