RUBAS:基于评分标准的强化学习智能体安全框架
摘要
RUBAS 是一个面向智能体安全的评分标准强化学习框架,将 LLM 智能体行为分解为四个维度——工具使用安全性、参数安全性、响应安全性和有用性——在完整轨迹上提供细粒度奖励。实验表明,RUBAS 在标准对齐基线基础上提升了安全性,同时减少了工具相关的幻觉现象,并保持了具有竞争力的实用性。
arXiv:2606.04051v1 公告类型:新论文
摘要:LLM 演进为具备工具调用能力的智能体后,带来了一类与现实世界执行相关的新型安全挑战,这有别于简单的文本生成场景。现有的对齐方法通常依赖粗粒度的拒绝信号或静态监督,难以在多样化的智能体风险场景中兼顾安全性与有效的工具执行。我们提出 RUBAS,一个面向智能体安全的评分标准强化学习框架。RUBAS 将智能体行为分解为四个维度:工具使用安全性、参数安全性、响应安全性和有用性。这些结构化评分标准在完整的智能体轨迹上提供细粒度且可解释的奖励,使强化学习能够在优化安全工具使用的同时保障任务完成能力。在多个智能体安全基准和模型上的大量实验表明,RUBAS 相比标准对齐基线提升了安全性,减少了工具相关的幻觉现象,并保持了具有竞争力的实用性。我们的结果表明,多维度评分标准奖励为在安全关键的工具使用场景中对齐 LLM 智能体提供了一种有效的训练信号。
查看缓存全文
缓存时间: 2026/06/05 02:19
# RUBAS:基于评分标准的智能体安全强化学习 来源:https://arxiv.org/html/2606.04051 Xian Qi Loye¹,Qinglin Su¹,Zhexin Zhang¹,Shiyao Cui¹,Qi Zhu²,Fei Mi²,Hongning Wang¹,Minlie Huang¹¹¹¹通讯作者。¹清华大学深圳研究生院会话式人工智能(CoAI)研究组,²华为诺亚方舟实验室 [email protected],[email protected] ###### 摘要 LLM 演进为支持工具调用的智能体,催生了一类与现实世界执行(而非简单文本生成)相关的全新安全挑战。现有对齐方法通常依赖粗粒度的拒绝信号或静态监督,难以在多样化的智能体风险场景中平衡安全性与有效的工具执行。我们提出 RUBAS——一种面向智能体安全的基于评分标准的强化学习框架。RUBAS 将智能体行为分解为四个维度:工具使用安全性、参数安全性、响应安全性和有用性。这些结构化评分标准为完整智能体轨迹提供细粒度、可解释的奖励,使强化学习能够在保持任务完成能力的同时优化安全的工具使用。在多个智能体安全基准和模型上的大量实验表明,RUBAS 在标准对齐基线基础上提升了安全性,减少了工具相关的幻觉,并保持了有竞争力的实用性。我们的结果表明,多维评分标准奖励为在安全关键的工具使用场景中对齐 LLM 智能体提供了有效的训练信号。 RUBAS:基于评分标准的智能体安全强化学习 Xian Qi Loye¹,Qinglin Su¹,Zhexin Zhang¹,Shiyao Cui¹,Qi Zhu²,Fei Mi²,Hongning Wang¹,Minlie Huang¹¹¹¹通讯作者。¹清华大学深圳研究生院会话式人工智能(CoAI)研究组,²华为诺亚方舟实验室 [email protected],[email protected] ## 1 引言 大型语言模型(LLM)智能体的出现,使 AI 从被动的文本生成器转变为能够通过外部工具调用感知、推理和操控环境的主动参与者 Wang et al.(2024 (https://arxiv.org/html/2606.04051#bib.bib34));Luo et al.(2025 (https://arxiv.org/html/2606.04051#bib.bib33));Wang et al.(2025 (https://arxiv.org/html/2606.04051#bib.bib17))。这些智能体可以执行网络搜索、与 API 交互以及管理文件系统,以完成复杂的多步骤任务 Li et al.(2024 (https://arxiv.org/html/2606.04051#bib.bib35))。然而,这一扩展的功能面带来了显著的安全风险,且日益难以缓解 Gan et al.(2024 (https://arxiv.org/html/2606.04051#bib.bib18))。 LLM 智能体的安全边界已超越文本内容安全,延伸至在环境中行动的完整轨迹 Ruan et al.(2024 (https://arxiv.org/html/2606.04051#bib.bib38));Yuan et al.(2024 (https://arxiv.org/html/2606.04051#bib.bib25))。我们考虑三大类威胁来源:存在风险或规范不足的用户指令、智能体在工具选择和执行过程中产生的自身失误,以及工具或外部系统返回的不可信反馈 Andriushchenko et al.(2025 (https://arxiv.org/html/2606.04051#bib.bib3));Debenedetti et al.(2024 (https://arxiv.org/html/2606.04051#bib.bib39))。针对上述威胁来源,安全的智能体行为必须满足四个维度。 第一,智能体必须通过避免使用未经授权的工具和不安全的动作序列来维护**工具使用安全性**。第二,必须通过向工具传递正确且无恶意的输入来保证**参数完整性**。第三,必须通过向用户产生安全响应(包括工具输出不正确或不安全时)来确保**响应安全性**。最后,必须在不采取不安全策略的前提下实现合法的用户目标,保持**有用性**。 因此,保障智能体安全不仅仅是过滤不安全的文本内容,更需要跨多轮交互对动作、观察和约束进行推理 Mou et al.(2026 (https://arxiv.org/html/2606.04051#bib.bib41));Li et al.(2026 (https://arxiv.org/html/2606.04051#bib.bib40))。 然而,现有的对齐策略难以同时解决上述维度。当前方法主要依赖监督微调(SFT)来提升智能体安全性 Zhang et al.(2025b (https://arxiv.org/html/2606.04051#bib.bib5));Xie et al.(2025 (https://arxiv.org/html/2606.04051#bib.bib6));Kumarage et al.(2025 (https://arxiv.org/html/2606.04051#bib.bib7)),然而 SFT 训练的模型可能仅仅模仿可观察到的安全模式,而未能内化安全轨迹的原则,导致表层对齐在不同智能体场景中退化。虽然强化学习(RL)提供了一条深度推理的路径,但用于智能体安全的传统 RL 方法 Sha et al.(2025 (https://arxiv.org/html/2606.04051#bib.bib8))通常依赖二元或稀疏奖励,无法捕捉在复杂环境中安全行动与保持有用性之间的细微权衡。我们认为,智能体安全需要对上述维度进行联合建模,而非孤立地修复各个组件,因为某一维度的失效往往会级联影响其他维度。 为此,我们提出 **RUBAS**——一种面向智能体安全的基于评分标准的强化学习框架。RUBAS 将"安全且有用的智能体行为"解释为一组结构化的子目标,这些子目标明确涵盖工具使用、参数处理、响应质量和任务完成,在安全对齐训练过程中实现多维度验证。关键在于,这些评分标准提供了一种透明、可解释的奖励机制,可通过 LLM 可靠生成。该方法基于以下观察:验证响应比生成输出本身更容易;通过利用这一不对称性,验证充当了强力的反馈机制,显著提升了模型性能 Huang et al.(2025 (https://arxiv.org/html/2606.04051#bib.bib12));McAleese et al.(2024 (https://arxiv.org/html/2606.04051#bib.bib28));Yu et al.(2025 (https://arxiv.org/html/2606.04051#bib.bib29));Madaan et al.(2023 (https://arxiv.org/html/2606.04051#bib.bib30))。通过将定性安全需求分解为清单式验证流程,RUBAS 将复杂的行为预期转化为细粒度、可验证的标准。这些标准随后由评分函数综合为稠密标量奖励信号,使强化学习能够联合优化安全性与任务完成能力。 总体而言,本文贡献如下: - •我们以四个可验证的维度构建了智能体安全对齐框架,涵盖用户驱动、工具执行和环境风险。 - •我们提出了一种将上述维度综合为结构化评分标准的方法,利用评分函数在训练过程中将多维定性反馈转化为标量奖励。 - •通过大量实验,我们证明 RUBAS 在显著降低有害性和幻觉的同时,保持了智能体有效调用工具的能力。 ## 2 相关工作 ### 2.1 基于 LLM 的智能体安全评估 智能体安全评估的研究已从早期对提示注入的关注 Zhan et al.(2024 (https://arxiv.org/html/2606.04051#bib.bib1))演进至工具调用风险 Xia et al.(2025 (https://arxiv.org/html/2606.04051#bib.bib2))、特定失效模式 Zhang et al.(2024b (https://arxiv.org/html/2606.04051#bib.bib4))、有害任务的综合评估 Andriushchenko et al.(2025 (https://arxiv.org/html/2606.04051#bib.bib3));Zhang et al.(2025a (https://arxiv.org/html/2606.04051#bib.bib14));Yuan et al.(2024 (https://arxiv.org/html/2606.04051#bib.bib25))以及专业场景 Levy et al.(2024 (https://arxiv.org/html/2606.04051#bib.bib24));Yin et al.(2024 (https://arxiv.org/html/2606.04051#bib.bib26));Guo et al.(2024 (https://arxiv.org/html/2606.04051#bib.bib27))。尽管取得了上述进展,现有基准主要聚焦于明显的恶意场景(如网络攻击),而忽视了良性情境下的隐性风险或双重用途工具的滥用问题。这一不足限制了当前基准评估安全协议能否泛化至日常模糊应用场景的能力。 ### 2.2 基于 LLM 的智能体安全对齐 当前面向 LLM 智能体的安全对齐方法主要沿两条路径展开:监督微调(SFT)和强化学习(RL)。基于 SFT 的方法 Zhang et al.(2025b (https://arxiv.org/html/2606.04051#bib.bib5));Xie et al.(2025 (https://arxiv.org/html/2606.04051#bib.bib6))及其结合直接偏好优化(DPO)的多阶段扩展 Xu et al.(2025 (https://arxiv.org/html/2606.04051#bib.bib23))通常专注于合成高质量的安全对齐轨迹和思维链数据 Kumarage et al.(2025 (https://arxiv.org/html/2606.04051#bib.bib7))。然而,这些范式从根本上受限于对密集监督的依赖,无法可靠地在监督轨迹之外诱导具备安全意识的行为。 近期的 RL 研究通过奖励信号直接优化智能体行为,提供了一种有前景的替代方案。基于规则的奖励 Sha et al.(2025 (https://arxiv.org/html/2606.04051#bib.bib8))提升了交互式工具使用场景中的安全性,但其粗粒度信号可能在检测到风险时鼓励过度保守的拒绝行为。因此,这些粗粒度奖励对于在复杂智能体交互中平衡安全性与实用性的指导作用有限 Zhang et al.(2025c (https://arxiv.org/html/2606.04051#bib.bib31))。 ### 2.3 基于评分标准奖励的强化学习 基于评分标准的奖励为偏好奖励和二元可验证奖励提供了一种结构化替代方案 Huang et al.(2025 (https://arxiv.org/html/2606.04051#bib.bib12));Xu et al.(2026 (https://arxiv.org/html/2606.04051#bib.bib50))。尽管 RLVR 对于具有显式正确性信号的任务(如数学和编程)非常有效 Wen et al.(2025 (https://arxiv.org/html/2606.04051#bib.bib15));Guo et al.(2025 (https://arxiv.org/html/2606.04051#bib.bib19)),但许多现实任务需要多维度评估。近期工作将实例特定的评分标准用于医学和科学推理 Gunjal et al.(2025 (https://arxiv.org/html/2606.04051#bib.bib11))、将清单式标准用于指令遵循 He et al.(2025 (https://arxiv.org/html/2606.04051#bib.bib13)),以及将专家整理的评分标准用于复杂多轮任务 Liu et al.(2025 (https://arxiv.org/html/2606.04051#bib.bib42))。这些研究表明,评分标准能够为 LLM 后训练提供细粒度、可解释的监督。 虽然已有工作证明了基于评分标准的奖励在推理、指令遵循和多轮任务完成方面的价值,但其在智能体安全领域的应用仍有待深入探索。RUBAS 通过合成多场景安全数据和面向轨迹级智能体对齐的综合评分标准,进一步拓展了这一方向。 ## 3 评分标准体系 ### 3.1 评分标准设计 参见图注图 1:RUBAS 框架概览。该框架首先通过组合风险类别、风险模式和工具环境来构建智能体安全任务,然后生成提示、环境设置和实例特定的评分标准。在 RL 训练过程中,策略采样工具使用轨迹,由基于评分标准的奖励函数进行评估,生成用于 GRPO 更新的奖励。 受近期基于评分标准奖励方法的启发(Gunjal et al.,2025 (https://arxiv.org/html/2606.04051#bib.bib11);Huang et al.,2025 (https://arxiv.org/html/2606.04051#bib.bib12)),我们设计了一种轨迹级评分标准,为智能体安全对齐提供结构化的强化信号。RUBAS 不依赖单一的整体评分,而是将智能体行为分解为四个同时涵盖任务能力和安全边界的维度: $$\mathcal{R}=\{r_{\text{tool}},r_{\text{arg}},r_{\text{res}},r_{\text{help}}\},$$ 分别对应**工具使用安全性**、**参数安全性**、**响应安全性**和**有用性**。这些维度针对第 1 节 (https://arxiv.org/html/2606.04051#S1) 中介绍的用户驱动、工具执行和环境风险。与主要评估响应级质量的先前评分标准方法(Liu et al.,2025 (https://arxiv.org/html/2606.04051#bib.bib42);Bhattarai et al.,2026 (https://arxiv.org/html/2606.04051#bib.bib43))不同,我们的评分标准具有轨迹感知能力:在统一的安全-有用性框架内,联合监督中间工具选择、工具参数和最终响应。 对于每个维度 $r_i \in \mathcal{R}$,我们整理了一组二元标准 $\{c_{i,1}, c_{i,2}, \dots, c_{i,k}\}$。每个标准 $c_{i,j}$ 充当可验证的信号,例如智能体是否遵循了所需的执行顺序,从而在该维度内提供细粒度的客观评估。标准从可复用的基础模板实例化:例如,`must_call_tool(t)` 检查轨迹是否调用了必需的工具,具体标准将 $t$ 绑定到场景特定的工具(如 `search_web`)。附录 A (https://arxiv.org/html/2606.04051#A1) 提供了详细的维度定义、维度权重、评分标准模板和标准评估流程。 ### 3.2 奖励框架 给定提示 $x$、响应轨迹 $\tau$ 和评分标准 $\mathcal{R}$,评分标准奖励计算为跨评分维度的加权聚合: $$R_{\text{rubric}}(\tau\mid x,\mathcal{R})=\frac{\sum_{i=1}^{|\mathcal{R}|}w_{i}\cdot r_{i}(\tau|x)}{\sum_{i=1}^{|\mathcal{R}|}w_{i}}$$ 每个维度得分是其标准的归一化加权平均值: $$r_{i}(\tau|x)=\text{norm}\!\left(\frac{\sum_{j=1}^{k}\alpha_{ij}\cdot c_{i,j}(\tau|x)}{\sum_{j=1}^{k}\alpha_{ij}}\right)$$ 其中,$\alpha_{ij}$ 控制标准 $c_{i,j}$ 在维度 $r_i$ 内的重要性,而 $w_i \in [0,3]$ 是赋予维度 $r_i$ 的固定权重。我们使用消融研究在每种数据类型内选定的固定维度聚合权重:例如,所有良性实例对 $r_{\text{tool}}$ 共享相同权重。这一设计在保持奖励计算可重现性的同时,允许不同实例类型强调不同的安全-实用性权衡。通过设置 $w_i = 0$ 可以禁用某个维度。 我们使用 $\operatorname{norm}(p)=2p-1$ 将标准满足度从 $[0,1]$ 映射到 $[-1,1]$。每个标准由特定标准的评分函数评估: $$c_{i,j}(\tau\mid x)=S_{i,j}(x,\tau)\in\{0,1\},$$ 其中 $S_{i,j}$ 检查轨迹的相关部分,如工具选择、工具参数或最终响应。除一个例外外,所有特定标准的评分函数均实现为确定性程序化检查;唯一的例外是拒绝判断评分函数,使用裁判模型实现。 RUBAS 还支持两种实用机制。第一,**不可妥协标准**强制执行关键协议约束:若任何严格标准被违反,对应维度将获得惩罚分数。第二,**加权标准问责制**为高影响行为分配更大的 $\alpha_{ij}$ 值,确保关键动作(如调用正确工具或避免不安全参数)在对应维度得分中占主导地位。 ## 4 方法 ### 4.1 提示与环境
相似文章
RubricEM:基于量规引导策略分解,超越可验证奖励的元强化学习
本文介绍了 RubricEM,这是一个强化学习框架,它利用量规引导的策略分解和基于反思的元策略进化,为长篇任务训练深度研究智能体。所得到的 RubricEM-8B 模型通过利用阶段感知规划和更密集的语义反馈,在长篇研究基准测试中表现出强劲的性能。
V-Rubrics:基于评估准则的强化学习实现视觉忠实性
提出一种基于评估准则的强化学习方法,通过将回答分解为原子命题,并从视觉忠实性、推理一致性和指令遵循度三个维度进行评分,从而提升视觉语言模型的视觉忠实性。
在改进之前学习评估:自动研究代理的自动评分标准归纳
AutoSciRub 是一个评估优先框架,通过生成任务特定的可执行评分标准来指导实验和验证,从而改进自主科学代理,在基准测试中实现一致的性能提升。
Co-ReAct:将评分标准作为 ReAct 代理的步骤级协作工具
Co-ReAct 引入了一种基于评分标准的动作选择框架,在推理过程中将评分标准作为 ReAct 代理的步骤级指导,提高了轨迹质量,并在 DeepResearchBench 和 SQA-CS-V2 上超越了基线模型。
生成减少智能体评估中过度信任的无奖励评判标准
RubricForge从带标签的轨迹中诱导评估标准,以减少语言模型智能体评估中的过度信任,增强保真度,而无需环境访问。