PolicyMem:用于LLM治理的几何策略记忆
摘要
PolicyMem提出了一种用于LLM治理的几何策略记忆,将自然语言策略外化为可重用的几何对象,以启用检测-重写-验证循环,并实现最先进的不安全行为检测。
arXiv:2609.13734v1 公告类型:新
摘要:随着大型语言模型(LLMs)在现实世界的高风险应用中越来越广泛部署,有效的治理变得至关重要。现有的防护措施主要遵循两种范式:基于学习的防护提供强大的语义区分,但将策略行为耦合到训练模型和分类法上;而可编程框架提供灵活的控制,但需要大量的手动提示和工作流工程。两者都未将策略外化为可重用的操作状态,使得在检测、干预和验证之间一致地重用策略证据变得困难。本文介绍了PolicyMem,一种几何策略记忆,它将自然语言策略外化为在共享表示空间中由低秩子空间表示的可重用几何记忆对象。记忆编译器将自然语言策略编译为策略记忆槽,而查询-响应对通过投影能量读取策略记忆。由此产生的策略-证据轮廓直接调解安全裁决,并被重用于策略归因和干预后验证。结合响应重写器,PolicyMem为LLM治理启用了检测-重写-验证循环。在五个广泛使用的基准测试中,PolicyMem实现了最先进的不安全行为检测,同时通过共享策略记忆启用了有效的策略归因、重写和干预后验证。
查看缓存全文
缓存时间: 2026/09/15 08:40
# PolicyMem:面向大语言模型治理的几何策略记忆
来源:https://arxiv.org/html/2609.13734
余源辰††注:本文工作完成于NEC实验室美国分部实习期间。
陈铮铮††注:通讯作者。
所属机构:NEC实验室美国分部
赵燕君
所属机构:伊利诺伊大学厄巴纳-香槟分校
王浩宇
所属机构:NEC实验室美国分部
佟杭杭、陈海峰
所属机构:伊利诺伊大学厄巴纳-香槟分校
所属机构:NEC实验室美国分部
###### 摘要
随着大语言模型(LLM)在现实世界高风险应用中的日益普及,有效的治理变得至关重要。现有的安全防护机制主要遵循两种范式:基于学习的防护模型提供了强大的语义判别能力,但将策略行为耦合于训练模型和分类体系;而可编程框架虽然提供灵活控制,却需要大量手动提示和工作流工程。这两种范式都未能将策略外化为可复用的操作状态,导致在检测、干预和验证过程中难以一致地复用策略证据。本文提出PolicyMem——一种几何策略记忆,它将自然语言策略表示为共享表示空间中可复用的几何记忆对象,以低秩子空间的形式编码。记忆编写器将自然语言策略编译为策略记忆槽位,查询-响应对通过投影能量读取策略记忆。由此生成的策略证据配置文件直接用于安全判定,并可复用于策略归因和干预后验证。结合响应重写器,PolicyMem实现了针对LLM治理的“检测-重写-验证”闭环流程。在五个广泛使用的基准测试中,PolicyMem在实现最先进不安全行为检测性能的同时,通过共享策略记忆支持了有效的策略归因、重写和干预后验证。
## 1 引言
参见图注
图1:PolicyMem与现有LLM治理范式对比。
大语言模型(LLM)在关键任务和高风险应用中的快速普及,使得有效的治理愈发重要。理想的治理系统不仅应给出单一安全判定,更应能*观察*(通过检测不安全行为并归因所涉策略)、*行动*(生成安全且有用的响应)并*验证*干预措施已解决违规问题。我们将此“观察-行动-验证”过程称为*闭环LLM治理*。然而,大多数现有安全机制仍以*判定为中心*:针对给定响应发出安全决策或风险分类,但未将被治理的策略暴露为可复用的操作状态。现有方法主要遵循两种范式:
**基于学习的防护模型**通过在精选数据集上微调专用安全模型提供强大的语义判别能力,但将策略行为隐式编码于模型参数和训练分类体系中(Inan et al., 2023;Han et al., 2024;Ghosh et al., 2024;Li et al., 2024),使得策略难以独立于模型进行检查、复用或修改。
**可编程防护框架**(如NeMo Guardrails (Rebedea et al., 2023;Dong et al., 2025))为黑箱生成器提供灵活的控制,但需要领域专家手动将应用策略转化为提示、规则或工作流。这些策略规范仍是文本工件,在推理时需要反复解释。
因此,这两种范式均未提供可在治理不同阶段一致复用的持久策略表示,阻碍了策略证据在统一“观察-行动-验证”治理闭环中的共享。
这些局限共同推动了*外化操作策略记忆*的需求。该表示应将每个治理策略转化为持久、可寻址、可复用的计算对象,并具有共享读取接口,使得策略级证据在策略间灵活可比,并在整个闭环治理过程中保持一致。一个自然的替代方案是将策略描述存储于文本知识库或记忆中(Zhang et al., 2025;Xu et al., 2026)。然而,文本记忆外化了策略内容而非策略执行:检索到的描述仍是被动上下文,而下游判断器必须在每次推理调用时重构策略的解释与应用方式。因此,存储的信息本身并不直接参与治理决策。这启发了我们的核心重构:不再仅将策略视为待检索的文本,而是将其表示为共享表示空间中的可复用操作记忆对象,如图1 (https://arxiv.org/html/2609.13734#S1.F1)所示。
因此,我们提出PolicyMem,将策略形式化为共享几何表示空间中的*子空间*。共享策略记忆编写器将每个自然语言策略映射为一个低秩子空间,作为操作策略记忆槽位;而查询-响应对则编码为案例表示,通过共享几何记忆读取操作查询已配置的策略记忆。由此生成的策略证据配置文件直接驱动安全判定,并可复用于策略归因和干预后验证。该设计将策略规范转化为统一操作状态,在治理闭环中提供可比且可复用的策略证据。
我们在五个广泛使用的安全基准上进行了PolicyMem的广泛实验,并辅以理论分析,证明其在实现最先进不安全行为检测的同时,支持了策略归因、响应重写和干预后验证。我们的贡献总结如下:
- **问题形式化**。我们将闭环LLM治理构建为观察-行动-验证过程,并引入操作策略记忆作为跨治理阶段的可复用策略表示。
- **新方法**。我们提出PolicyMem——一种操作几何策略记忆,它将策略外化为低秩几何子空间,可在统一治理框架内驱动安全决策,同时支持策略归因、响应重写和干预后验证。
- **全面评估**。我们在五个广泛使用的基准上进行了大量实验,证明PolicyMem在实现最先进不安全行为检测性能的同时,支持了可解释的策略归因、有效重写和干预后验证。
## 2 相关工作
### 2.1 LLM安全治理
LLM安全治理旨在检测和缓解部署过程中的不安全模型行为,通常通过学习安全模型或可编程控制机制实现。基于学习的防护模型(如Llama Guard (Inan et al., 2023;Grattafiori et al., 2024) 和WildGuard (Han et al., 2024))在精选安全数据上训练,用于分类提示或响应,在某些情况下还能识别风险类别(Ghosh et al., 2024;Li et al., 2024;Yin et al., 2025;Liu et al., 2025;Zhao et al., 2025)。然而,其策略行为仍与训练模型、分类体系或提示接口耦合。
可编程防护框架(以NeMo Guardrails (Rebedea et al., 2023)和审核服务(Markov et al., 2023)为代表)则围绕黑箱生成器协调提示、规则、动作和安全后端。它们提供有用的控制流,但要求应用策略被手动操作化。
### 2.2 面向LLM智能体的记忆
记忆已成为LLM智能体的重要组成部分,使其能够保留超出即时上下文窗口的信息并复用过去的经验(Zhang et al. (2025);Wei et al. (2025);Zhou et al. (2026))。大多数设计遵循一个共同原则:外化选定的经验、事实或反思,然后检索和更新相关项目以支持未来的推理和行动(Maharana et al. (2024);Chhikara et al. (2025);Bei et al. (2026))。例如,Generative Agents存储情景经验和更高层次的反思用于行为规划(Park et al., 2023),而A-MEM则通过结构化笔记和语义链接组织记忆(Xu et al., 2026)。这些系统主要将记忆视为可检索的上下文知识。然而,LLM治理需要一种面向执行的策略状态。现有记忆方法并非为提供此类决策因果接口而设计,这推动了我们几何空间策略记忆的提出。
## 3 方法
PolicyMem是一个围绕外化几何策略记忆构建的闭环治理器。配置的策略被编写为低秩记忆槽位,而候选响应则通过投影能量读取此记忆。治理器首先调用共享评估器以生成交付判定和策略索引证据。当需要干预时,响应重写器生成修订后的响应,并使用评估器和策略记忆进行重新评估。图2 (https://arxiv.org/html/2609.13734#S2.F2)展示了PolicyMem的整体工作流程。
### 3.1 问题形式化
我们考虑用户查询 \( q \)、LLM生成的候选响应 \( r^{(0)} = r \),以及一个配置的策略集 \( \mathcal{T} = \{ t_p \}_{p=1}^{N_{\mathcal{T}}} \),其中 \( N_{\mathcal{T}} = |\mathcal{T}| \)。策略集被物化为操作记忆 \( \mathcal{M}_{\mathcal{T}} \),其构建在3.2节(https://arxiv.org/html/2609.13734#S3.SS2)介绍。PolicyMem治理器包含一个共享策略评估器 \( \mathcal{A}_{\Theta} \) 和一个响应重写器 \( \mathcal{R}_{\Psi} \)。评估器和重写器共同实现了闭环LLM治理:*观察*对应于不安全行为检测和策略归因,*行动*对应于重写,*验证*对应于重写后验证。
**不安全行为检测**。评估器首先评估原始候选:
\[
\bigl(\hat{y}^{(0)}, \mathbf{e}^{(0)}\bigr) = \mathcal{A}_{\Theta}\bigl(q, r^{(0)}; \mathcal{M}_{\mathcal{T}}\bigr),
\]
其中 \( \hat{y}^{(0)} \in \{\texttt{safe}, \texttt{unsafe}\} \) 是交付判定,\( \mathbf{e}^{(0)} \in [0, 1]^{N_{\mathcal{T}}} \) 包含每个配置策略记忆槽位的一个证据值。如果 \( \hat{y}^{(0)} = \texttt{safe} \),治理器交付 \( r^{(0)} \)。否则,证据配置文件识别应指导安全重写行动的策略。
**策略引导重写**。对于任何仍不安全的候选 \( r^{(t)} \),治理器选择其能量最高的策略记忆槽位,并将它们映射回其自然语言描述:
\[
\widehat{\mathcal{S}}^{(t)}_k = \operatorname{TopK}\!\left( \mathbf{e}^{(t)}, k \right), \quad \mathcal{F}^{(t)} = \{ t_p : p \in \widehat{\mathcal{S}}^{(t)}_k \}.
\]
基于此针对性反馈,重写器生成下一个候选:
\[
r^{(t+1)} = \mathcal{R}_{\Psi}\bigl(q, r^{(t)}, \mathcal{F}^{(t)}\bigr).
\]
在 \( t=0 \) 时,输入是原始响应及其最初牵涉的策略。在后续轮次中,输入是上一次重写版本以及验证后仍被牵涉的策略。
**重写后验证**。每个修订后的候选由相同的评估器和配置策略记忆评估:
\[
\bigl(\hat{y}^{(t+1)}, \mathbf{e}^{(t+1)}\bigr) = \mathcal{A}_{\Theta}\bigl(q, r^{(t+1)}; \mathcal{M}_{\mathcal{T}}\bigr).
\]
安全判定终止循环并允许交付。否则,\( \mathbf{e}^{(t+1)} \) 为下一次重写提供针对性策略反馈。该循环最多执行 \( B \) 次尝试,一旦未检测到违规即提前停止。如果在预算用尽后最终候选仍被标记,治理器将返回一个回退拒绝。我们将此有界的检测-重写-验证过程称为*闭环LLM治理*。
### 3.2 几何策略记忆
我们现在通过将每个配置的策略表示为学习治理空间中的一个低秩子空间来实例化操作策略状态。单向量表示将策略限制在一个方向上,但同一策略治理下的违规可能源于异构意图、推理模式和语言实现。为此,我们使用低秩子空间表示每个记忆槽位,它可以捕获多个策略相关方向,同时保持紧凑表示和基于投影的闭式读取(Yew et al. (2026))。
**基于文本的策略表示**。令 \( F_{\omega} \) 表示策略分支和案例分支共享的自适应LLM编码器。编码并池化策略 \( t_p \) 得到:
\[
\widetilde{\mathbf{a}}_{p} = \operatorname{Pool}\!\left( F_{\omega}(t_p) \right) \in \mathbb{R}^{d_h},
\]
其中 \( d_h \) 是编码器隐藏维度。在训练期间,我们维护一个脱离的锚点 \( \mathbf{a}_{p} \in \mathbb{R}^{d_h} \) 以跟踪 \( \widetilde{\mathbf{a}}_{p} \),为记忆写入操作提供稳定的、基于文本的输入。锚点是写入时的表示,而非部署的记忆槽位。其更新机制在3.6节(https://arxiv.org/html/2609.13734#S3.SS6)描述。
**通过子空间编译进行记忆写入**。子空间编译器 \( \Gamma_{\gamma}: \mathbb{R}^{d_h} \rightarrow \mathbb{R}^{d_g \times r_s} \) 将每个锚点映射到候选策略方向,其中 \( d_g \) 是治理空间维度,\( r_s \) 是子空间秩。记忆写入操作为:
\[
\mathbf{B}_{p} = \Gamma_{\gamma}(\mathbf{a}_{p}) \in \mathbb{R}^{d_g \times r_s},
\]
\[
\mathbf{U}_{p} = \text{qf}(\mathbf{B}_{p}), \quad \mathbf{U}_{p}^{\top} \mathbf{U}_{p} = \mathbf{I}_{r_s},
\]相似文章
PolicyBank:为LLM智能体演进策略理解
PolicyBank提出了一种记忆机制,使LLM智能体能够通过迭代交互和纠正反馈自主改进对组织策略的理解,弥补导致系统性行为偏离真实需求的规范差距。该工作引入了一个系统化测试平台,并展示PolicyBank能够解决高达82%的策略差距对齐失败,显著超越现有记忆机制。
面向长周期LLM代理的Meta-Cognitive Memory Policy Optimization
介绍了Belief Entropy和Metacognitive Memory Policy Optimization (MMPO),以提高长周期LLM代理的记忆质量,优于现有方法,并在长上下文中保持性能。
MemGuard: 用于LLM智能体记忆治理的持久化验证器信号
MemGuard引入了一个系统,将验证器信号持久化为元数据以治理LLM智能体中的记忆,从而提高了在多个基准测试(如SWE-Bench和WebArena)中的可靠性和性能。
多智能体LLM系统的受控共享内存
本文介绍了MemClaw,一种用于多智能体LLM系统的受控共享内存架构,形式化了诸如未授权泄漏和过时传播等故障模式,并通过ArgusFleet测试框架评估了该系统。
Fortunate Recall:基于本体的LLM记忆生命周期管理,实现持久一致性
本文介绍了Fortunate Recall,一种基于本体的策略层,用于管理LLM中的记忆生命周期。它将个人信息分类为行为类别,并应用差异策略来提高一致性和减少幻觉,在基准测试中优于现有系统。