模块化预训练实现访问控制

arXiv cs.LG 论文

摘要

本文介绍了GRAM(梯度路由辅助模块),一种模块化预训练方法,通过选择性添加和消融模块来限制AI模型的双重用途能力,实现访问控制,并显示出相较于数据过滤的成本降低。

arXiv:2607.08077v1 公告类型:新 摘要:AI开发者面临双重用途困境。一种帮助用户治愈疾病的AI能力,也可能被他人用于合成疾病。这一困境可通过访问控制来解决,将双重用途的AI能力限制在具有合法需求的可信部署中。访问控制的黄金标准是为不同用户提供具有不同能力的独立模型。然而,训练和部署多个模型的成本过高。为应对这一挑战,我们提出梯度路由辅助模块(GRAM),这是一种预训练方法,通过在神经网络中添加模块并选择性更新它们来诱导专业化。在推理时消融一个模块可将其能力从网络中移除,近似于在过滤数据上训练的模型。我们在合成故事以及涵盖病毒学、网络安全、核物理和专用代码的现实双重用途数据上评估了GRAM。这些实验表明,GRAM能够禁用目标能力同时保留其他能力,并且在微调下比事后遗忘更能抵抗能力恢复。最重要的是,从50M到5B参数的Chinchilla最优缩放分析显示,数据过滤模型与全数据模型在移除能力上的差距随规模扩大而增大,但在保留能力上保持较小,且GRAM紧密跟踪数据过滤。GRAM的训练成本与支持的能力配置文件数量无关,在我们的5配置文件设置中,相较于数据过滤实现了5倍成本降低。
查看原文
查看缓存全文

缓存时间: 2026/07/10 06:18

# 模块化预训练实现访问控制
来源:https://arxiv.org/abs/2607.08077  
作者:Ethan Roland (https://arxiv.org/search/cs?searchtype=author&query=Roland,+E), Murat Cubuktepe (https://arxiv.org/search/cs?searchtype=author&query=Cubuktepe,+M), Erick Martinez (https://arxiv.org/search/cs?searchtype=author&query=Martinez,+E), Stijn Servaes (https://arxiv.org/search/cs?searchtype=author&query=Servaes,+S), Keenan Pepper (https://arxiv.org/search/cs?searchtype=author&query=Pepper,+K), Mike Vaiana (https://arxiv.org/search/cs?searchtype=author&query=Vaiana,+M), Diogo Schwerz de Lucena (https://arxiv.org/search/cs?searchtype=author&query=de+Lucena,+D+S), Judd Rosenblatt (https://arxiv.org/search/cs?searchtype=author&query=Rosenblatt,+J), Addie Foote (https://arxiv.org/search/cs?searchtype=author&query=Foote,+A), Cem Anil (https://arxiv.org/search/cs?searchtype=author&query=Anil,+C), Alex Cloud (https://arxiv.org/search/cs?searchtype=author&query=Cloud,+A)

查看 PDF (https://arxiv.org/pdf/2607.08077)

> **摘要:** 人工智能开发者面临一个双重用途的困境:一种能够帮助用户治愈疾病的能力,同样也能被另一个人用来合成疾病。这一困境可以通过访问控制来解决,即将具有双重用途的AI能力限制在可信且确有需求的部署环境中。访问控制的黄金标准是向不同用户提供具备不同能力的独立模型。然而,训练和部署多个模型的成本过高。为了解决这一挑战,我们提出了梯度路由辅助模块(GRAM),这是一种预训练方法,通过在神经网络中添加模块并选择性地更新它们来诱导专业化。在推理时消融某个模块会将其能力从网络中移除,从而近似于一个在过滤数据上训练的模型。我们在合成故事以及涵盖病毒学、网络安全、核物理和专业代码的真实双重用途数据上对GRAM进行评估。这些实验表明,GRAM能够禁用目标能力同时保留其他能力,并且在微调下抵抗能力恢复方面优于事后遗忘。最重要的是,从50M到5B参数的中国狸花猫最优缩放分析显示,经过数据过滤的模型与完整数据模型之间,在被移除能力上的差距随规模扩大而增大,而在保留能力上的差距保持很小,并且GRAM与数据过滤的结果高度一致。GRAM的训练成本与所支持的能力配置文件数量无关,在我们的5配置文件设置中,相比数据过滤实现了5倍的降低。

## 提交历史

来自:Alex Cloud \[查看电子邮件 (https://arxiv.org/show-email/80ce6cc9/2607.08077)\] **\[v1\]** 2026年7月9日星期四 03:12:44 UTC(675 KB)

相似文章

多模块 GRPO:组合策略梯度与提示优化的语言模型程序方法

Papers with Code Trending

本文提出 mmGRPO,一种多模块扩展的群体相对策略优化(GRPO)方法,通过优化语言模型调用和提示来提升模块化 AI 系统的准确率。实验表明,该方法在各类任务上平均带来 11% 的准确率提升,并在 DSPy 中提供了开源实现。