SafeCommit:认证记忆接地智能体何时可以安全行动
摘要
SafeCommit 提出一个风险控制层,认证记忆接地的大语言模型智能体何时可以安全行动,使用共形行动证书来限制不安全承诺的概率,并提供一个带有公开代码的模拟器。
查看缓存全文
缓存时间: 2026/08/06 07:42
# SafeCommit:何时可以安全地让基于记忆的智能体行动——一种认证机制
来源:https://arxiv.org/html/2608.04289
Mayur Akewar 佛罗里达国际大学 makew001@fiu\.edu&Ravi Ranjan11footnotemark:1 佛罗里达国际大学 rkuma031@fiu\.edu
###### 摘要
长周期智能体越来越多地使用持久化记忆和工具来执行具有外部副作用的行动。一个核心失败模式是过早承诺:智能体在尚未解决其记忆基础是否过时、冲突、不完整或已损坏之前就采取行动。我们将此问题形式化为*记忆不确定性下的安全承诺*,并引入SafeCommit,一个位于智能体推理与外部执行之间的风险控制层。该层根据记忆、观察、工具输出、溯源和政策约束构建一个经过校准的合理潜在世界集合。只有当一致性行动证书表明该行动在每一个保留的世界中都是安全的,它才允许执行有副作用的行动。否则,它会选择一个针对阻碍认证的世界的低副作用探针,或返回一个保守的回退方案。在校准的世界覆盖率下,不安全认证承诺的概率最多为目标水平α\alpha;若世界提议不完美,该界限将校准误差与表示误差分开。一个无依赖的受控模拟器展示了安全性与效用之间的权衡,并可一键复现所有报告结果。目标是提供一种具体方法,不仅决定智能体*应该做什么*,而且决定*何时现有证据足以安全地去做*。源代码和实验工件可在https://github.com/akewarmayur/SafeCommit公开获取。
## 1 引言
大语言模型(LLM)智能体正从单轮助手转向能够记忆、推理、调用工具并在长期交互中采取行动的系统。ReAct确立了推理与工具使用交织的价值\[21 (https://arxiv.org/html/2608.04289#bib.bib1)\],而Reflexion和更新的记忆系统使用持久化反馈和组织化记忆来改善未来行为\[17 (https://arxiv.org/html/2608.04289#bib.bib2),20 (https://arxiv.org/html/2608.04289#bib.bib5)\]。OSWorld和Mem2ActBench等基准进一步表明,长周期行动依赖于跨工具和变化环境的上下文维护\[19 (https://arxiv.org/html/2608.04289#bib.bib4),16 (https://arxiv.org/html/2608.04289#bib.bib6)\]。因此,记忆正在成为智能体控制状态的一部分,而非被动存储。
这种转变创造了一种单纯依靠更强的检索无法解决的失败模式。一条记忆可能相关,但基于它行动仍然不安全:文件路径可能已被重新用途化,接收者可能已更换,先前的权限可能已过期,或注入的记录可能模仿可信历史。记忆投毒研究表明,恶意记录可以改变下游智能体行为\[3 (https://arxiv.org/html/2608.04289#bib.bib7),4 (https://arxiv.org/html/2608.04289#bib.bib8)\]。在这些情况下,智能体可能产生合理的推理,而当前证据的若干安全相关解释仍未得到解决。
现有防护措施解决的是相邻但不同的问题。澄清方法请求缺失信息\[6 (https://arxiv.org/html/2608.04289#bib.bib22),18 (https://arxiv.org/html/2608.04289#bib.bib23)\];不确定性感知方法可能在置信度低时弃权\[2 (https://arxiv.org/html/2608.04289#bib.bib24),22 (https://arxiv.org/html/2608.04289#bib.bib25)\];访问控制系统限制允许执行哪些操作\[1 (https://arxiv.org/html/2608.04289#bib.bib9)\];效果感知底层通过暂存和沙箱暴露或限制副作用\[15 (https://arxiv.org/html/2608.04289#bib.bib20),23 (https://arxiv.org/html/2608.04289#bib.bib27)\]。这些机制都很有价值,但没有一种本身能为以下问题提供决策规则:*给定记忆、当前观察、工具输出和政策约束,一个提议的行动是否在所有仍然合理的解释下都是安全的?*
我们将此问题研究为*记忆不确定性下的安全承诺*。在决策步骤中,智能体保留一个校准的合理潜在世界集合。一个世界代表一个与安全相关的解释,例如记录是否最新、权限是否仍然有效、或检索到的记忆是否被投毒。只有当候选行动在所有的保留世界中都安全时,它才获得证书。如果没有行动可被认证,控制器选择一个低副作用的探针——例如元数据读取、权限检查、暂存差异、模拟或澄清——该探针预计会移除阻碍认证的世界。如果不确定性无法在预算内解决,控制器会推迟、升级或弃权。
这一视角不同于为行动分配标量置信度。证书是集合值的且反事实的:它询问是否有任何保留世界使该行动不安全。它还将不确定性估计与证据获取联系起来,因为探针的价值取决于它们能多大程度缩小*未认证区域*,而非通用信息增益。
#### 定位。
表1 (https://arxiv.org/html/2608.04289#S1.T1)总结了区别。记忆和检索方法改善了呈现给智能体的证据,但通常只生成一个工作上下文。选择性行动方法决定标量置信度是否足够高以行动,但不保留明确的安全相关替代方案。访问控制检查操作在策略下是否被允许,这是必要的,但不能解决底层状态或意图是否过时。效果中介系统使行动可检查或可逆,但仍需要规则来释放最终效果。SafeCommit被设计为决策层,消费来自这四个方面的信号。
表 1:概念定位。“Worlds”指明确的替代安全相关状态;“targeted probe”指针对行动认证优化的证据获取。| 方法 | 示例 | 保留世界? | 针对性探针? | 释放规则? |
|---|---|---|---|---|---|
| 记忆/检索 | RAG、Reflexion | 否 | 否 | 无 |
| 选择性行动 | 校准置信度 | 否 | 有时 | 阈值 |
| 访问控制 | 策略引擎 | 否 | 否 | 策略允许 |
| 效果中介 | 暂存、沙箱 | 可能 | 否 | 需要 |
| **SafeCommit** | **本工作** | **是** | **是** | **证书** |
这一区别在某个行动既被允许又得到一条记忆的充分支持、但在另一个合理世界中却不安全时尤为重要。例如,智能体可能被授权删除工作区中的文件,但一条旧记忆可能指向一个此后已变为共享的目录。访问控制允许删除,检索呈现旧指令,置信度分数可能偏向于删除。剩下的问题是当前证据是否排除了目录被重新用途化的世界。SafeCommit使这个未解决的替代方案显式化,并阻止释放,直到元数据或暂存效果探针将其移除。
我们的贡献是:
1. 1.我们使用校准的合理世界集合和行动级安全语义,形式化了基于记忆的有副作用智能体的安全承诺问题。
2. 2.我们引入SafeCommit,一个带有一致性行动证书、精确安全等价压缩以及校准与表示误差显式分解的承诺-探针-回退控制器。
3. 3.我们提供一个紧凑、无依赖的模拟器和一键实验,该实验在过时、冲突、投毒和授权转移的记忆中隔离机制。该实验特意作为概念验证,而非完整部署智能体验证的声明。
## 2 问题形式化
### 2\.1 证据、行动和潜在世界
在决策步骤tt,智能体拥有局部证据
xt=\(mt,ot,zt,ct\),x\_\{t\}=\(m\_\{t\},o\_\{t\},z\_\{t\},c\_\{t\}\),\(1\)其中mtm\_\{t\}是检索到的记忆,oto\_\{t\}是当前观察,ztz\_\{t\}包含最近的工具输出,ctc\_\{t\}包含策略、授权或执行约束。历史hth\_\{t\}还包括先前的探针及其结果。令At\mathcal\{A\}\_\{t\}为候选的有副作用行动,Pt\mathcal\{P\}\_\{t\}为低副作用探针。终端决策为
Dt=\{commit\(a\):a∈At\}∪\{defer,escalate,abstain\}\.\\mathcal\{D\}\_\{t\}=\\\{\\textsc\{commit\}\(a\):a\\in\\mathcal\{A\}\_\{t\}\\\}\\cup\\\{\\textsc\{defer\},\\textsc\{escalate\},\\textsc\{abstain\}\\\}.\(2\)底层智能体可以使用LLM提议行动和探针。控制器将这些提议视为候选,而非它们安全的证据。
由于证据可能允许多种解释,令Ωt\Omega\_\{t\}为潜在世界空间,ωt⋆∈Ωt\omega\_\{t\}^\{\\star\}\\in\\Omega\_\{t\}为真实世界。构造函数CαC\_\{\\alpha\}将历史映射到一个合理世界集合
Wt=Cα\(ht\)⊆Ωt,P\(ωt⋆∈Wt\)≥1−α\.\\mathcal\{W\}\_\{t\}=C\_\{\\alpha\}\(h\_\{t\}\)\\subseteq\\Omega\_\{t\},\\qquad\\mathbb\{P\}\(\\omega\_\{t\}^\{\\star\}\\in\\mathcal\{W\}\_\{t\}\)\\geq 1\-\\alpha\.\(3\)在实践中,构造函数在有限的决策相关支持集Ω^t\(ht\)\\widehat\{\\Omega\}\_\{t\}\(h\_\{t\}\)或符号单元上操作。每个候选世界根据溯源、年龄、与当前观察的一致性、工具一致性和策略兼容性获得非一致性分数st\(ω\)s\_\{t\}\(\\omega\)。利用在留出校准案例上估计的分裂一致性阈值κα\\kappa\_\{\\alpha\},
Wt=\{ω∈Ω^t\(ht\):ωis hard\-evidence consistent andst\(ω\)≤κα\}\.\\mathcal\{W\}\_\{t\}=\\\{\\omega\\in\\widehat\{\\Omega\}\_\{t\}\(h\_\{t\}\):\\omega\\text\{ is hard\-evidence consistent and \}s\_\{t\}\(\\omega\)\\leq\\kappa\_\{\\alpha\}\\\}.\(4\)这种构造不需要枚举每个潜在事实;它必须保留可能改变行动安全性的区别。
### 2\.2 工作示例
考虑一个被要求删除临时输出并发送完成通知的智能体。检索到的记忆表明/work/run/latest是可丢弃的,且ops@example\.org是批准的接收者。当前证据不完整:目录列表显示最近的文件,但未显示该路径现在是否是指向符号链接,接收者记录也没有最近的时间戳。单状态智能体可能推断删除和发送都是适当的。
一个决策相关支持集可以包含三个世界。在ω1\\omega\_\{1\}中,路径仍然是临时的,接收者有效;两个行动都安全。在ω2\\omega\_\{2\}中,路径被重新用途化为共享结果;删除不安全,但发送安全。在ω3\\omega\_\{3\}中,接收者记忆被注入或已取代;发送不安全,但非破坏性文件检查是安全的。如果这三个世界都通过校准而存活,则删除和发送都没有空的未认证区域。
控制器现在可以为被阻塞的决策选择探针。一个不跟随符号链接和所有权检查可以区分ω1\\omega\_\{1\}与ω2\\omega\_\{2\},而目录或授权查找可以区分ω1\\omega\_\{1\}与ω3\\omega\_\{3\}。一个通用问题如“你确定吗?”可能无法解决任何事实。在探针之后,智能体可以认证发送行动,将删除替换为可逆的暂存移动,或者在接收者仍不确定时升级。该示例说明了为什么框架只表示可能改变行动安全性的事实,以及为什么探针与行动证书相关联,而非与广泛的不确定性降低相关联。
### 2\.3 行动证书
每个世界诱导一个安全允许行动集合Γt\(ω\)⊆At\\Gamma\_\{t\}\(\\omega\)\\subseteq\\mathcal\{A\}\_\{t\}。对于行动aa,定义未认证区域
Ut\(a\)=\{ω∈Wt:a∉Γt\(ω\)\}\.\\mathcal\{U\}\_\{t\}\(a\)=\\\{\\omega\\in\\mathcal\{W\}\_\{t\}:a\\notin\\Gamma\_\{t\}\(\\omega\)\\\}\.\(5\)
###### 定义 1\(一致性行动证书\)。
当Ut\(a\)=∅\\mathcal\{U\}\_\{t\}\(a\)=\\emptyset时,行动a∈Ata\\in\\mathcal\{A\}\_\{t\}是α\\alpha认证的。
一个看似合理的行动可能在某个可能的世界中是安全的。一个被认证的行动在目标覆盖率水平下保留的每个世界中仍然安全。
###### 命题 1\(不安全承诺控制\)。
假设停止时间τ\\tau处的集合满足式 \(3 (https://arxiv.org/html/2608.04289#S2.E3)\),且控制器只承诺具有Uτ\(a\)=∅\\mathcal\{U\}\_\{\\tau\}\(a\)=\\emptyset的行动。则
P\(aτ∉Γτ\(ωτ⋆\)\)≤α\.\\mathbb\{P\}\\\!\\left\(a\_\{\\tau\}\\notin\\Gamma\_\{\\tau\}\(\\omega\_\{\\tau\}^\{\\star\}\)\)\\right\)\\leq\\alpha\.\(6\)
###### 证明。
如果ωτ⋆∈Wτ\\omega\_\{\\tau\}^\{\\star\}\\in\\mathcal\{W\}\_\{\\tau\}且未认证区域为空,那么被承诺的行动在真实世界中是安全的。因此,不安全承诺只有在ωτ⋆∉Wτ\\omega\_\{\\tau\}^\{\\star\}\\notin\\mathcal\{W\}\_\{\\tau\}时才可能发生,其概率至多为α\\alpha。 ∎
有限提议机制可能在校准之前遗漏真实世界。令β=P\(ωt⋆∉Ω^t\(ht\)\)\\beta=\\mathbb\{P\}\(\\omega\_\{t\}^\{\\star\}\\notin\\widehat\{\\Omega\}\_\{t\}\(h\_\{t\}\)\)。如果只要真实世界被提议,条件一致性覆盖率至少为1−α1\-\\alpha,则并集论证给出实际界限
P\(unsafe commit\)≤β\+\(1−β\)α≤α\+β\.\\mathbb\{P\}\(\\text\{unsafe commit\}\)\\leq\\beta\+\(1\-\\beta\)\\alpha\\leq\\alpha\+\\beta\.\(7\)这将误校准与表示失败分开,而不是将两者隐藏在一个置信度分数后面。
### 2\.4 安全等价压缩与探针
世界可能在无关细节上不同,但在行动安全性上一致。定义行动签名
σt\(ω\)=\(1\[a∈Γt\(ω\)\]\)a∈At\.\\sigma\_\{t\}\(\\omega\)=\\big\(\\mathbf\{1\}\[a\\in\\Gamma\_\{t\}\(\\omega\)\]\\big\)\_\{a\\in\\mathcal\{A\}\_\{t\}\}.\(8\)具有相同签名的世界是安全等价的。用每个等价类的一个代表替换,可以精确保留认证行动集合,因为认证只取决于每个保留的签名是否将行动标记为安全。
当没有行动被认证时,探针p∈Ptp\\in\\mathcal\{P\}\_\{t\}产生结果yy,成本为c\(p\)c\(p\),并将世界集合更新为Wt\+1y,p\\mathcal\{W\}\_\{t\+1\}^\{y,p\}。控制器寻求减少阻碍认证的世界的探针,同时保持副作用和交互成本较低。这种承诺-探针-回退决策将在下一节展开。
## 3 SafeCommit方法
SafeCommit位于智能体的记忆/工具推理循环与外部执行之间。它不取代基础智能体、访问控制或沙箱。相反,它决定证据是否足以释放一个提议的行动。
1\. 收集证据——记忆、观察、工具输出、溯源、策略2\. 构建合理世界——硬过滤\+\+校准的非一致性阈值在每个保留的世界中都安全?3a\. 承诺——释放认证的行动3b\. 探针——澄清、检查元数据、检查权限、暂存或模拟3c\. 回退——推迟、升级或弃权是 否,有用探针 否,预算/证据不足图 1:SafeCommit将记忆不确定性转换为显式的承诺-探针-回退决策。只有当没有保留的合理世界使提议的行动不安全时,该行动才会被释放;否则,一个低副作用探针会更新证据并重复检查。
### 3\.1 合理世界构建
默认构造函数有四个步骤。首先,它从检索到的记忆、当前观察、最近的工具结果、溯源字段、策略约束和领域规则中提议一个有界支持集。其次,它移除与硬证据矛盾的世界,例如不可能的时间戳、无效权限或相互不一致的工具输出。第三,它应用式 \(4 (https://arxiv.org/html/2608.04289#S2.E4)\),使用仅基于校准的阈值。第四,它合并具有相同行动签名的世界。LLM可以帮助提议候选世界,但保留集合受结构化证据和策略谓词的约束,而非仅受模型推理的影响。
安全映射Γt\\Gamma\_\{t\}是领域特定的。对于文件行动,它可以编码受保护路径、可逆性以及效果揭示…相似文章
SafeHarbor:面向LLM代理安全的分层记忆增强护栏
SafeHarbor是一个用于LLM代理安全的新型框架,它利用分层记忆和自进化机制来平衡安全性与实用性,在良性任务和恶意任务上均实现了最先进的性能。
当代理过早承诺:诊断LLM代理的过早承诺
本文引入表征承诺,这是一种跨运行隐藏状态收敛,用于诊断LLM代理何时过早锁定了轨迹。研究表明,承诺预测轨迹一致性而非正确性,并提出了监控方法,用于检测代理何时自信地稳定下来,而不是假设一致性等于可信度。
CAGE: Certified Authorization under Typed-Return Uncertainty for Tool-Using Agents
This paper introduces CAGE, a certification method that verifies whether tool-using LLM agents remain authorized under typed-return uncertainty, including binding faults and numerical drift. It proves that separate channel certification is insufficient and provides exact and learned-gate variants for practical authorization.
内存增强型LLM智能体中的状态污染
本文识别并研究了LLM智能体中的“记忆洗白”现象,即有毒或对抗性上下文被压缩成记忆摘要后,能够逃避标准毒性检测器,同时仍影响后续生成。文章引入了亚阈值传播间隙(SPG)来衡量隐藏的下游影响,并表明在摘要之前对有毒状态进行消毒比事后清理更有效。
The LLM Proposes, the Executive Disposes: A Self-Verifying Agent Instrument that Dissociates Commitment Drift from Binding Drift in Long-Horizon Agents
Presents a verification instrument for long-horizon agents that structurally separates commitment drift from binding drift, using a deterministic executive and pre-registered predictions. Reports ablation results showing commitment mechanism removal flips goal abandonment from 0 to 1 while binding error stays flat, though task efficacy is null on ARC-AGI-3.