模块化预训练实现访问控制
摘要
本文介绍了GRAM(梯度路由辅助模块),一种模块化预训练方法,通过选择性添加和消融模块来限制AI模型的双重用途能力,实现访问控制,并显示出相较于数据过滤的成本降低。
查看缓存全文
缓存时间: 2026/07/10 06:18
# 模块化预训练实现访问控制 来源:https://arxiv.org/abs/2607.08077 作者:Ethan Roland (https://arxiv.org/search/cs?searchtype=author&query=Roland,+E), Murat Cubuktepe (https://arxiv.org/search/cs?searchtype=author&query=Cubuktepe,+M), Erick Martinez (https://arxiv.org/search/cs?searchtype=author&query=Martinez,+E), Stijn Servaes (https://arxiv.org/search/cs?searchtype=author&query=Servaes,+S), Keenan Pepper (https://arxiv.org/search/cs?searchtype=author&query=Pepper,+K), Mike Vaiana (https://arxiv.org/search/cs?searchtype=author&query=Vaiana,+M), Diogo Schwerz de Lucena (https://arxiv.org/search/cs?searchtype=author&query=de+Lucena,+D+S), Judd Rosenblatt (https://arxiv.org/search/cs?searchtype=author&query=Rosenblatt,+J), Addie Foote (https://arxiv.org/search/cs?searchtype=author&query=Foote,+A), Cem Anil (https://arxiv.org/search/cs?searchtype=author&query=Anil,+C), Alex Cloud (https://arxiv.org/search/cs?searchtype=author&query=Cloud,+A) 查看 PDF (https://arxiv.org/pdf/2607.08077) > **摘要:** 人工智能开发者面临一个双重用途的困境:一种能够帮助用户治愈疾病的能力,同样也能被另一个人用来合成疾病。这一困境可以通过访问控制来解决,即将具有双重用途的AI能力限制在可信且确有需求的部署环境中。访问控制的黄金标准是向不同用户提供具备不同能力的独立模型。然而,训练和部署多个模型的成本过高。为了解决这一挑战,我们提出了梯度路由辅助模块(GRAM),这是一种预训练方法,通过在神经网络中添加模块并选择性地更新它们来诱导专业化。在推理时消融某个模块会将其能力从网络中移除,从而近似于一个在过滤数据上训练的模型。我们在合成故事以及涵盖病毒学、网络安全、核物理和专业代码的真实双重用途数据上对GRAM进行评估。这些实验表明,GRAM能够禁用目标能力同时保留其他能力,并且在微调下抵抗能力恢复方面优于事后遗忘。最重要的是,从50M到5B参数的中国狸花猫最优缩放分析显示,经过数据过滤的模型与完整数据模型之间,在被移除能力上的差距随规模扩大而增大,而在保留能力上的差距保持很小,并且GRAM与数据过滤的结果高度一致。GRAM的训练成本与所支持的能力配置文件数量无关,在我们的5配置文件设置中,相比数据过滤实现了5倍的降低。 ## 提交历史 来自:Alex Cloud \[查看电子邮件 (https://arxiv.org/show-email/80ce6cc9/2607.08077)\] **\[v1\]** 2026年7月9日星期四 03:12:44 UTC(675 KB)
相似文章
@AnthropicAI: We’re pleased to have collaborated with AE Studio on this research. Read more here: https://anthropic.com/research/off-…
Anthropic and AE Studio propose GRAM (Gradient-Routed Auxiliary Modules), a method to surgically confine dual-use knowledge in AI models to removable modules, enabling selective access without retraining multiple models. Preliminary results show promise for more flexible safety controls.
多模块 GRPO:组合策略梯度与提示优化的语言模型程序方法
本文提出 mmGRPO,一种多模块扩展的群体相对策略优化(GRPO)方法,通过优化语言模型调用和提示来提升模块化 AI 系统的准确率。实验表明,该方法在各类任务上平均带来 11% 的准确率提升,并在 DSPy 中提供了开源实现。
Anthropic 发表了关于 GRAM 的研究:一种在权重层面精准移除 AI 模型危险知识的技术
Anthropic 发表了关于 GRAM 的研究,该技术旨在从 AI 模型的权重层面精确移除危险知识,从而推动 AI 安全的发展。
2026年7月8日 对齐 一种针对AI模型中双重用途知识的关闭开关
Anthropic和AE Studio推出了GRAM方法,该方法将AI模型中的双重用途知识限制在可移除模块中,从而无需重新训练整个模型即可对危险能力进行精准控制。初步结果表明,这有望实现前沿模型的更安全部署。
最大化GRPO信号:针对困难推理问题的自适应轨迹前缀控制
本文介绍了AdaPrefix-GRPO,一种在GRPO训练期间自适应控制提供给模型的正确解决方案前缀长度的方法,保持50%的成功率以最大化梯度信号。它在显著提高困难数学推理问题准确率的同时降低了计算成本。