DreamGuard:基于风险感知世界模型的高效LLM智能体运行时护栏

arXiv cs.AI 论文

摘要

DreamGuard是一种面向LLM智能体的主动式运行时护栏,利用风险感知世界模型跟踪潜在状态并预测未来风险,从而在不安全动作执行前进行干预。它在基准测试和在线评估中优于基线,延迟为25毫秒。

arXiv:2608.05695v1 公告类型:新 摘要:随着大语言模型(LLM)智能体越来越多地调用外部工具并与真实世界系统交互,不安全动作可能对外部状态、用户数据和下游服务造成不可逆的后果。现有的运行时护栏通过在执行前检查提议动作来缓解此类风险,但其中许多仍是被动式的:它们主要评估当前动作的表面安全性,缺乏对风险如何在轨迹中演变的显式建模。这一局限性为长期风险造成了关键盲点——单个看似良性的动作可能逐渐将智能体引向危险状态。为此,我们提出DreamGuard,一种围绕风险感知世界模型构建的LLM智能体主动式护栏。该世界模型在轨迹上维护一个紧凑的循环潜在状态,并预测未来潜在状态,DreamGuard从中推导出即时危险和前缀风险证据,然后在执行前将这些多时间尺度信号融合为干预决策。在四个基准测试和一次在线护栏评估中的实验表明,DreamGuard优于通用、被动式和主动式护栏基线,在所评估的护栏中实现了最佳的安全-效用权衡,并保持了每次调用平均25毫秒的端到端延迟。
查看原文
查看缓存全文

缓存时间: 2026/08/07 07:47

# 面向LLM智能体的高效运行时护栏:基于风险感知世界模型
来源:https://arxiv.org/html/2608.05695
Wenhao Lin1, Chenyu Yu1, Xingwei Lin1\corresponding, Sicong Cao2\corresponding, Xiang Chen1, Lei Xue3, Le Yu2, Letian Sha2, Chunming Wu1

###### 摘要

随着大语言模型(LLM)智能体越来越多地调用外部工具并与真实世界系统交互,不安全的行为可能对外部状态、用户数据和下游服务造成不可逆转的后果。近期的运行时护栏通过在执行前检查提议的行为来缓解此类风险,但许多护栏仍然是被动反应式的:它们主要评估当前行为表面的安全性,缺乏对风险如何在轨迹上演化的显式建模。这一局限为长期风险(long-horizon risks)留下了关键的盲区,在这些风险中,单独看似良性的行为可能逐渐将智能体推向危险状态。为此,我们提出DreamGuard,一种围绕风险感知世界模型构建的LLM智能体主动式护栏。该世界模型在轨迹上维护一个紧凑的循环潜在状态,并预测未来的潜在状态,DreamGuard从中推导即时危害(immediate-hazard)与前缀风险(prefix-risk)证据。随后,它在行为执行前将这些多时间尺度信号融合为干预决策。在四个基准测试和一次在线护栏评估中的实验表明,DreamGuard优于通用、被动反应式和主动式护栏基线,在所评估的护栏中实现了最佳的安全-效用权衡,并保持每次调用平均25毫秒的端到端延迟。

## 1 引言

大语言模型(LLM)智能体现在可以通过调用外部工具并与真实世界系统交互,在开放环境中自主执行复杂任务(Xie等人 2025 (https://arxiv.org/html/2608.05695#bib.bib36);Qin等人 2024 (https://arxiv.org/html/2608.05695#bib.bib37);Wang等人 2024 (https://arxiv.org/html/2608.05695#bib.bib38))。由于这些行为可能影响外部状态、用户数据和下游服务,确保智能体的运行时安全已成为一个关键问题(Ma等人 2025 (https://arxiv.org/html/2608.05695#bib.bib30);Yu等人 2025 (https://arxiv.org/html/2608.05695#bib.bib31);Gan等人 2026 (https://arxiv.org/html/2608.05695#bib.bib32);Deng等人 2025 (https://arxiv.org/html/2608.05695#bib.bib35))。

近期研究为LLM智能体引入了运行时护栏,这些护栏在轨迹上下文中评估每个提议的行为,并在执行前对不安全行为施加干预(Xiang等人 2025 (https://arxiv.org/html/2608.05695#bib.bib4);Chen等人 2025 (https://arxiv.org/html/2608.05695#bib.bib5);Wen等人 2026 (https://arxiv.org/html/2608.05695#bib.bib6))。这些护栏能够拦截即时危害,即如果在当前步骤执行会直接导致危险结果的行为,例如删除文件、泄露凭证或调用未经授权的外部API。

然而,许多现有的运行时护栏仍然是被动反应式的:它们评估当前提议行为表面的安全性,而不对风险如何在轨迹上演化或该行为如何改变未来风险进行建模。这一局限为长期风险留下了关键的盲区,在这些风险中,早期步骤单独看起来可能是良性的,但逐渐累积为危险结果。例如,一个智能体可能定位内部文件,将其移动到工作区文件夹,然后创建一个公开共享链接;每个操作在局部看似常规,但累积的轨迹将最终行为转变为机密数据泄露。主要基于局部状态评估每个提议行为的护栏难以检测到这种风险累积。

为此,近期的研究已转向主动式护栏,这些护栏结合轨迹上下文或前瞻预测来评估当前行为如何影响未来风险。然而,它们在真实世界部署中仍面临若干挑战。(i)运行时护栏必须高效且轻量。许多主动式护栏依赖LLM来处理轨迹历史(Li等人 2026 (https://arxiv.org/html/2608.05695#bib.bib20);Chen等人 2026 (https://arxiv.org/html/2608.05695#bib.bib19))。随着智能体轨迹增长,这些设计受到上下文窗口长度的限制,并需要越来越昂贵的自回归推理,通常导致每步多秒的延迟。这给实时智能体执行的延迟预算带来了压力。(ii)预测应保留风险证据。主动式护栏可能预测未来的状态或后果,然后用单独的安全规则或评判器对其进行评估(Liu等人 2026c (https://arxiv.org/html/2608.05695#bib.bib27);Wang等人 2025b (https://arxiv.org/html/2608.05695#bib.bib34))。然而,这种分离可能使风险评估依赖于不完整的预测:当预测并非为风险判别而学习时,安全评估可能缺乏识别潜在风险所需的证据。这要求风险感知的潜在状态能够暴露危险转移,而不仅仅是预测通用的未来结果。(iii)运行时干预需要校准的多时间尺度风险。主动式护栏日益通过轨迹记忆、状态跟踪或未来风险估计来对风险演化进行建模(Li等人 2026 (https://arxiv.org/html/2608.05695#bib.bib20);Dhodapkar和Pishori 2026 (https://arxiv.org/html/2608.05695#bib.bib14);Wang等人 2026b (https://arxiv.org/html/2608.05695#bib.bib33))。然而,在危害变得明确之前,长期证据往往较弱,而即时危害证据则需要在当前行为边界处做出果断干预。挑战在于将这些互补信号校准为一个干预规则,既能在早期发出警告,又不会引发过多的误报。

为应对这些挑战,我们提出DreamGuard,一种围绕风险感知世界模型构建的高效LLM智能体运行时护栏。具体而言,为克服效率挑战(i),DreamGuard通过基于GRU的循环动力学维护一个固定维度的状态,避免通过LLM重复处理不断增长的轨迹。为解决风险证据挑战(ii),DreamGuard学习潜在动力学,旨在显式保留预测潜在状态中危险转移的证据。最后,为应对多时间尺度风险干预挑战(iii),DreamGuard将即时危害和前缀风险信号整合到一个稳健的决策机制中。

我们在四个涵盖即时危害和长期风险的智能体安全基准上评估了DreamGuard。实验表明,DreamGuard优于通用、被动反应式和主动式护栏基线,同时将平均端到端延迟降低至每次调用25毫秒。它还在96.3%的不安全长期轨迹中,在首个危害行为之前进行干预。在我们的在线护栏评估中,DreamGuard实现了最佳的安全-效用权衡,达到了72.92%的安全率,同时保持了90.38%的任务效用。

我们的贡献总结如下:

- •我们提出了DreamGuard,一种围绕轻量级风险感知世界模型构建的高效运行时护栏,该模型维护一个紧凑的循环状态,并在行为执行前估计多时间尺度风险。这一设计使得在实时智能体执行过程中,能够针对即时危害和长期风险进行主动干预。
- •我们在四个智能体安全基准上进行了广泛评估。实验表明,DreamGuard在缓解多时间尺度风险方面优于护栏基线,能更早干预长期风险,并保持高效的端到端延迟。
- •我们进一步在在线护栏评估中验证了DreamGuard,它在所评估的护栏中实现了最佳的安全-效用权衡,展示了其在实时智能体执行过程中的实际有效性。

## 2 相关工作

#### LLM智能体护栏。

通用LLM护栏如LlamaGuard(Inan等人 2023 (https://arxiv.org/html/2608.05695#bib.bib1))和WildGuard(Han等人 2024 (https://arxiv.org/html/2608.05695#bib.bib3))专注于内容审核,根据有害内容分类法对提示或响应进行分类。LLM智能体从根本上改变了这一范式:其输出成为影响外部环境的行为,将护栏的目标从内容审核转变为行为安全。例如,GuardAgent(Xiang等人 2025 (https://arxiv.org/html/2608.05695#bib.bib4))和AGrail(Luo等人 2025b (https://arxiv.org/html/2608.05695#bib.bib7))将特定任务的安全要求转化为可执行的行为检查,而ShieldAgent(Chen等人 2025 (https://arxiv.org/html/2608.05695#bib.bib5))根据策略派生的时间规则验证轨迹。类似地,TS-Guard(Mou等人 2026 (https://arxiv.org/html/2608.05695#bib.bib9))和AgentDoG(Liu等人 2026b (https://arxiv.org/html/2608.05695#bib.bib10))训练专门的护栏模型来验证行为与轨迹的安全性。然而,这些方法主要作为被动反应式护栏运行,未能有效识别在多步智能体交互中出现的长期风险。

为缓解长期风险,进一步的研究工作正通过结合轨迹上下文或前瞻预测转向主动式护栏。例如,SafetyDrift(Dhodapkar和Pishori 2026 (https://arxiv.org/html/2608.05695#bib.bib14))和ProbGuard(Wang等人 2025a (https://arxiv.org/html/2608.05695#bib.bib18))在手工业离散或符号安全状态上估计未来违规概率,而MAGE(Wang等人 2026b (https://arxiv.org/html/2608.05695#bib.bib33))和SafeAgent(Liu等人 2026c (https://arxiv.org/html/2608.05695#bib.bib27))维护安全相关记忆或运行时状态以进行风险评估。近期基于世界模型的护栏如SafePred(Chen等人 2026 (https://arxiv.org/html/2608.05695#bib.bib19))和SafeMCP(Wang等人 2026a (https://arxiv.org/html/2608.05695#bib.bib26))进一步使用LLM前瞻推理进行未来风险预测。尽管有这些进展,这些方法仍然难以针对多时间尺度风险提供高效的运行时保护,它们通常依赖于基于LLM的推理或领域特定的行为空间。

#### 面向智能体安全的世界模型。

对于主动式智能体护栏,预测提议行为的后果对于在不安全结果发生前进行干预至关重要。世界模型长期以来被用于基于模型的决策,以捕捉环境动态并支持对预测未来的规划。潜在世界模型如PlaNet(Hafner等人 2019 (https://arxiv.org/html/2608.05695#bib.bib21))、DreamerV3(Hafner等人 2025 (https://arxiv.org/html/2608.05695#bib.bib22))和TD-MPC2(Hansen等人 2024 (https://arxiv.org/html/2608.05695#bib.bib23))从交互数据中学习紧凑的潜在动力学,并使用预测的未来进行规划或控制。这一思想也被应用于LLM智能体:WebDreamer(Gu等人 2025 (https://arxiv.org/html/2608.05695#bib.bib24))和WMA(Chae等人 2025 (https://arxiv.org/html/2608.05695#bib.bib25))模拟网页导航中的行为结果。超越任务性能,SafePred(Chen等人 2026 (https://arxiv.org/html/2608.05695#bib.bib19))使用基于LLM的世界模型预测行为后果,并将风险估计输入决策循环,而SafeMCP(Wang等人 2026a (https://arxiv.org/html/2608.05695#bib.bib26))依赖基于LLM的对环境动态的前瞻推理。尽管有这些进展,现有的用于LLM智能体安全的世界模型通常依赖基于LLM的前瞻推理,这可能导致每次行为的高昂成本。DreamGuard则使用轻量级的基于GRU的循环动力学,从轨迹数据维护一个紧凑的风险状态,从而为运行时干预实现高效的风险估计。

## 3 方法

参见图注图1:DreamGuard概览。(1)风险感知世界模型:将轨迹前缀和提议行为编码为循环潜在状态,预测后继潜在状态,并产生即时危害和前缀风险分数。(2)多时间尺度风险估计:聚合时间风险证据,并应用校准的干预规则,在行为执行前输出运行时决策。### 3.1 问题表述

我们考虑一个LLM智能体,它在长度为TiT\_\{i\}的轨迹ii上与外部环境交互。运行时风险可能来自不安全的用户意图、对抗性攻击或智能体不完美的推理。这些风险可能是即时的,即某个行为在当前步骤是危险的;也可能是长期的,即某个行为在局部看似良性,但通过累积的轨迹上下文导致危险结果。我们将护栏表述为一个步骤级决策问题。在每一步tt,在提议行为被执行之前,护栏G\\mathcal\{G\}接收

xi,t=\(e,Hi,t,ai,t\),x\_\{i,t\}=\(e,\\mathcal\{H\}\_\{i,t\},a\_\{i,t\}\),(1)其中ee表示给智能体的任务指令,ai,ta\_\{i,t\}表示智能体在第tt步提议的行为,oi,to\_\{i,t\}表示智能体在执行ai,ta\_\{i,t\}之前可获得的当前环境观察。轨迹前缀Hi,t=\(oi,1,ai,1,oi,2,...,ai,t−1,oi,t\)\\mathcal\{H\}\_\{i,t\}=\(o\_\{i,1\},a\_\{i,1\},o\_\{i,2\},\\ldots,a\_\{i,t\-1\},o\_\{i,t\}\)包含在ai,ta\_\{i,t\}之前可获得的交互历史。护栏输出一个步骤级决策:

di,t=G\(xi,t\)∈\{PASS,HOLD,BLOCK\}。d\_\{i,t\}=\\mathcal\{G\}\(x\_\{i,t\}\)\\in\\\{\\mathrm\{PASS\},\\mathrm\{HOLD\},\\mathrm\{BLOCK\}\\\}。(2)PASS\\mathrm\{PASS\}允许行为执行,HOLD\\mathrm\{HOLD\}在证据低置信度或反映累积风险时中断执行并触发保守干预,BLOCK\\mathrm\{BLOCK\}中断执行并阻止该行为。

对于一条危险轨迹,令tihazt\_\{i\}^\{\\mathrm\{haz\}\}表示第一个危害步骤,即其提议行为如果执行将触发具体危险结果或转移的最早步骤。主要的运行时目标是在不安全行为执行前估计步骤级风险并进行干预,在tihazt\_\{i\}^\{\\mathrm\{haz\}\}处返回HOLD\\mathrm\{HOLD\}或BLOCK\\mathrm\{BLOCK\},同时最小化安全轨迹上的误报警。

### 3.2 DreamGuard概述

DreamGuard的目标是为运行时护栏配备主动风险预测能力,使其能够识别可能导致危险结果的提议行为。如图1 (https://arxiv.org/html/2608.05695#S3.F1)所示,DreamGuard由两个模块组成。风险感知世界模型在轨迹上维护一个紧凑的潜在状态,并从预测的潜在状态中估计即时危害和前缀风险证据。随后,多时间尺度风险估计模块聚合时间证据,并将融合分数映射为校准的干预决策。算法1 (https://arxiv.org/html/2608.05695#alg1)形式化了运行时工作流。

### 3.3 风险感知世界模型

#### 循环世界模型架构。

通过重建原始未来观察来学习生成模型提供了丰富的信号,但准确的原始重建成本高昂,且不能直接确定智能体行为是否安全。对于运行时护栏,模型必须捕捉轨迹前缀在提议行为下如何演化,并保留干预所需的与安全相关的信息。受DreamerV3(Hafner等人 2025 (https://arxiv.org/html/2608.05695#bib.bib22))和TD-MPC2(Hansen等人 2024 (https://arxiv.org/html/2608.05695#bib.bib23))的启发,DreamGuard构建了一个循环状态空间世界模型(RSSM)

相似文章

具备潜在推理能力的鲁棒高效护栏

arXiv cs.AI

CoLaGuard 是一种新型护栏模型,它将多步安全推理转移到连续潜在空间中,与显式推理基线相比,实现了 12.9 倍的加速和 22.4 倍的 Token 缩减,同时在十个安全基准上匹配宏 F1 性能。

BraveGuard:从开放世界威胁到更安全的计算机使用代理

Hugging Face Daily Papers

BraveGuard 是一个自我演化的防御框架,通过利用开放世界威胁信号和真实的代理轨迹来训练防护模型,从而提升计算机使用代理的安全检测能力,在 AgentHazard 基准上取得了显著的准确率提升。