Granite.Trust Policy Tools: 面向生成式AI应用的可共享、可操作策略

arXiv cs.AI 论文

摘要

本文介绍了Granite.Trust Policy Tools,该工具包含可操作策略模式和合成数据生成管道,旨在让组织在整个生成式AI应用生命周期内定义和执行可定制的安全策略。这些工具已开源,以促进更广泛的采用和贡献。

arXiv:2608.23870v1 Announce Type: new 摘要:在生成式AI的安全策略方面,一刀切的方法并不适用。每个组织和用例都需要根据应用背景、监管环境、组织价值观和用户角色来缓解不同的风险。然而,现有的策略规范方法是为传统访问控制设计的,未能捕捉到生成式AI应用的细微差别:基于内容的约束执行。 我们提出两项贡献来弥补这一差距:(1)可操作策略模式,一种基于YAML的格式,用于指定模型响应可以包含和不能包含的内容。该模式支持基于例外的策略治理,提出例外以跟踪策略违规;(2)合成数据生成管道,用于生成与策略对齐的训练数据,以进行模型对齐和测试,以及一套帮助定义模式和执行策略的工具。这些工具共同使组织能够指定一次策略,并在整个生成式AI应用生命周期中执行它们:从模型对齐到运行时监控。可操作策略模式、示例策略和工具均以开源形式提供:https://github.com/ibm-granite/granite.trust.policy-tools 我们欢迎新的想法、贡献和反馈。
查看原文
查看缓存全文

缓存时间: 2026/08/26 09:14

# 面向生成式AI应用的可共享、可执行政策  
来源:https://arxiv.org/html/2608.23870  

## Granite.Trust 政策工具:面向生成式AI应用的可共享、可执行政策  

作者:Nicolas Mello、Kush R. Varshney、Heiko Ludwig  
所属机构:Kate Soule、David Cox  
所属机构:IBM Research  

###### 摘要  

在生成式AI的安全政策方面,不存在“一刀切”的解决方案。每个组织和使用案例都需要根据应用场景、监管环境、组织价值观和用户画像来缓解不同的风险。然而,现有的策略规范方法是为传统访问控制设计的,未能捕捉生成式AI应用的本质特征——即基于内容的约束实施。本文提出两项贡献以填补这一空白:  
(1) **可操作政策模式**:一种基于YAML的格式,用于规范模型响应中允许和禁止包含的内容。该模式支持基于例外的策略治理,通过提出例外来跟踪策略违规;  
(2) **合成数据生成管道**:生成符合策略的训练数据,用于模型对齐和测试,并提供一套工具辅助模式定义和策略实施。  

这些工具使组织能够一次定义政策,并在生成式AI应用的整个生命周期中实施——从模型对齐到运行时监控。可操作政策模式、示例策略及工具均已开源:https://github.com/ibm-granite/granite.trust.policy-tools  

我们欢迎新想法、贡献与反馈。  

> 您的应用、您的策略、您的模型:使用这些可操作政策工具是以您自己的方式定义政策的第一步  

## 1 引言  

生成式AI应用因其生成特性(响应和动作由基于大规模语料库训练的大语言模型生成),带来了传统企业应用所不具备的新型安全及其他风险。同时,生成式AI应用在企业中的行为受到监管机构、客户、公众及企业内部各利益相关者的审视,目标是满足安全性、安全性、合规性或业务期望。这些期望通常被定义为**政策**。在受监管的环境中,行为必须遵守政策。在生成式AI时代,这一基本要求并未改变,但政策的本质发生了变化。  

定义风险态势和相应政策是确保生成式AI应用开发与部署周期符合要求的一套程序的前提。真实世界的企业与消费者生成式AI应用及智能体需要其专属的政策。  

如图1所示,所提出的政策框架概览:在阶段1,政策作为风险管理流程的结果被定义以缓解相关风险。风险可能变化,政策也随之调整。所得政策用于阶段2的多种应用,包括为模型对齐生成合成数据集、部署前合规性评估、合规监控和运行时执行。  

如图2所示,政策格式提供了具体的**例外类型**定义,允许跟踪策略违规并在应用或上游(其他智能体)中进行妥善处理。图中第三个示例展示了例外传递给智能体的过程,以便智能体能适当处理。  

尽管生成式AI应用的风险管理是一个分类学议题(例如NIST AI RMF、MIT AI风险库、IBM风险图谱),但目前尚未有统一的方法来定义能够影响生成式AI应用行为的**政策**。虽然已有研究探讨如何充分回答多样化问题,但当风险实际发生时如何**按政策响应**,在很大程度上仍是未解决的挑战。  

理想的政策规范应能实现非常具体的控制和监督设计。图1说明了风险与政策如何相互关联(阶段1),以及定义政策如何直接影响模型对齐、测试和红队演练阶段(阶段2)的一系列流程。详细要求见第2节。  

如图1阶段1所示,风险产生于生成式AI应用与其部署环境的交互。风险分析方法旨在发现这些风险,并以促成应用成功的方式进行管理。在此过程中,风险可能被**接受**,此时仅需记录发现过程。但对于不可接受的风险,则需要缓解政策。  

### 1.1 生成式AI的政策差距  

风险识别与可执行政策之间的差距,正是本文提出的Granite.trust政策工具要解决的问题。它们提供了一种前所未有的生成式AI应用政策规范方式。传统访问控制政策(XACML、OPA/Rego、Cedar)回答诸如“用户X能否访问资源Y?”这类基于属性的二元决策问题。生成式AI政策则必须回答本质上不同的问题:  
- 模型响应中可以包含哪些内容?  
- 模型应如何拒绝有害请求?  
- 当政策边界被越过时应记录哪些例外?  
- 如何传达策略违规信息?  

除了上述挑战,我们发现每个组织都拥有独特的政策集合,且不与其他组织共享。**没有一刀切的解决方案**。因此,需要一种格式,让法律专家、应用所有者等利益相关者能与AI专家协作表达此类政策。只有明确的政策定义,才能确保生成式AI应用得到适当监督。  

政策还能加强对模型默认设置和护栏未覆盖方面的监督。仅依赖现有护栏和模型对齐并不能解决问题。护栏是针对不易验证的原则定制的,用户对风险的识别缺乏灵活性。微调模型作为识别策略违规的替代方案,需要获取能紧密反映组织政策的数据集。然而,在网上找到此类数据集的可能性不高。例如,涉及竞争对手请求的数据集数量有限。因此,能够创建反映期望政策行为的数据集的方法将改善政策合规状况。提出的政策工具可帮助将这些控制措施定制到非常具体的应用场景。  

### 1.2 贡献  

本文做出以下贡献:  
1. **政策模式**(第3节):一种基于YAML的内容规范政策格式,人类可读且机器可执行。该模式定义了响应中允许和禁止的内容、如何拒绝请求以及应抛出的例外。  
2. **政策驱动的合成数据生成**(第4节):一个生成对抗性提示和与给定政策一致的安全响应的管道,支持模型微调和合规测试。无论您的政策如何,该管道都能生成用于模型对齐、护栏构建或应用红队测试的数据。  
3. **基于例外的策略治理**:我们的政策定义提供了一种跨应用边界跟踪策略违规的方式(图2)。后续论文将详细阐述此方面。  
4. **补充工具**:我们评估了该格式对政策规范的适用性,识别并实现了额外工具以改进政策定义过程。  

第2节介绍了驱动设计的要求,第3节展示了提出的模式,第4节介绍生成符合政策要求的合成数据的管道。第5节呈现了法律和技术用户使用评估的结果,第6节强调了我们开发的一些用于促进政策定义和合规的工具。我们在第7节总结报告。  

## 2 要求与相关工作  

> 无法测量的,就无法控制。清晰的政策定义是有效评估和治理的前提。  

我们创建了政策格式来规范能够直接影响大语言模型和生成式AI应用行为的政策。具体要求如下:  

1. **人类可理解**:风险评估和管理需要技术团队、法律顾问和合规官员之间的协作。政策格式必须让非程序员可读。律师应能无需学习复杂的政策语言,就为特定风险指定应用应如何行为。根据经验,我们发现讨论很容易陷入过于抽象而无法执行的政策。提出的模式应确保利益相关者之间的讨论能产生**可执行、可实施和可验证**的结果,明确什么能回复、什么不能。  

2. **机器可执行**:虽然人类可读性至关重要,但政策还必须足够精确以驱动自动化工具。自由形式的自然语言政策会导致模糊的解释,无法可靠执行或测试。规范必须具体到足以支持:  
   - 用于模型对齐的合成数据生成  
   - 自动化合规测试  
   - 运行时政策执行  

3. **版本化以支持合规**:合规框架(如ISO 42001、欧盟AI法案)要求跟踪政策随时间的变化。格式必须支持版本化以实现审计跟踪和合规认证。在IBM Research为其Granite模型开发流程进行的ISO 42001认证审计中,就要求了这种版本控制。此外,它有助于跟踪我们生成了哪些数据集、使用了哪些定义,以及如何缓解新风险。  

4. **跨组织与智能体可共享**:组织应能与合作伙伴、监管机构和社区分享政策。标准格式支持政策比较、冲突检测和协作式政策开发。  

5. **例外感知**:当政策边界被越过时,系统必须知道如何响应。受软件异常处理启发,政策应定义类型化的例外,这些例外可在应用栈中传播,实现一致的违规处理。  

### 2.1 为何现有方法不足  

已有多种技术旨在最小化风险。  

#### 2.1.1 风险管理分类与框架  

迄今为止,已提出多种风险分类法。这些分类法在识别部署生成式AI应用前需考虑的潜在风险方面发挥着日益重要的作用。它们是推理安全与安保的第一块基石。著名的风险框架包括AI风险图谱、OWASP Top 10、MIT风险库、AIR分类法等。基准测试如AILuminate、HELM、AirBench、BBQ等也提出了额外的分类法。  

然而,风险管理不能止步于此。下一步是评估每项风险,以确定是否需要缓解措施以及措施是什么。在某些情况下,风险可能需要部署缓解策略,而在其他情况下,接受风险就足够了。这需要通过明确定义的流程来确定风险应被接受还是以特定方式解决。  

网络安全领域的示例风险管理框架包括OCTAVE。在AI领域,Credo AI提出了生成AI缓解技术的步骤。他们的方法允许制定通用的风险缓解政策(如使用访问控制),但其提出的**政策包**是闭源的,难以全面比较。相比之下,我们的方法是开源的,并且更具体——我们可以非常清晰地指定如何生成**政策驱动的数据集**,用于系统对齐或验证。  

另一种方法是OSCAL Compass,这是一个云原生的合规空间,允许使用用户易于理解的语言定义政策。我们的方法针对不同的用例:**如何按政策响应用户请求并验证合规性**。我们的政策模式受到LlavaGuard的启发,该模型专为视觉模型设计,包含约八项政策。我们扩展了政策规范,增加了版本控制(以支持ISO 42001认证)、风险的高级描述、为便于生成式AI应用可靠错误处理和智能体交互而设计的**例外**定义,以及期望的补救措施。  

风险缓解技术还包括红队演练方法,用于验证大语言模型和生成式AI应用以确保发现缺陷。这些方法通常生成针对特定大语言模型漏洞(如角色扮演)的合成提示。它们通常需要**种子**(冒犯性内容的示例提示)或描述测试内容的**场景**定义。红队演练方法可与所提政策结合,以定制评估(仅标记或根据是否违反政策来优先处理问题),并在政策指定的领域内定位目标问题。  

#### 2.1.2 依赖模型默认安全与安保  

首选方案是依赖模型和护栏提供的**预设**安全和政策。大语言模型通常出于安全和安保原因进行了对齐。护栏是旨在规范模型输出的附加模型。这些通常是良好的第一道防线;然而,这些方法经过训练以遵守通用的安全原则、宪章或模型提供者定义的模型规范。通常,...

相似文章

2026年4月9日政策:实践中的可信智能体

Anthropic Research

Anthropic 发布了一篇研究文章,详细阐述如何在实践中构建可信的 AI 智能体,概述了核心安全原则以及 Claude Code 和 Claude Cowork 等产品实现。