不可逆预算:智能体操作系统的集群级风险核算与准入控制
摘要
本文提出了不可逆预算,这是一种针对LLM智能体集群的累积风险核算系统,用于管理共享主体风险并防止单个控制措施遗漏的超额风险。
arXiv:2609.00275v1 公告类型:新
摘要:LLM智能体集群现在会产生无法完全撤销的外部效应:它们移动资金、部署代码、删除数据和泄露信息。当前的控制措施一次只检查一个效应,因此,一组各自授权的智能体可以在共享触发条件下超额承担其主体的风险,同时每个本地门控都保持正确。我们提出了不可逆预算,这是一个累积的残余风险价值账户,由可信运行时为每个主体在智能体、工作流和租户之间维护。将不可逆性视为一等资源,运行时会向每个效应收取其在智能体下方的残余损失,并在总额将超额预算时拒绝边际效应。正确设定价格是困难的,因为效应是异构的、对抗性声明的和相关的。我们进行了一项对照实验,其中每个效应的门控允许高达租户风险限制48倍的集群级超额风险,而预算将每个正确收费的运行保持在该限制内。保守的、依赖感知的定价仍然是可部署设计的核心开放问题。
查看缓存全文
缓存时间: 2026/09/02 06:00
# 不可逆性预算:智能体操作系统的集群级风险核算与准入控制 来源:https://arxiv.org/html/2609.00275 会议:智能体操作系统研讨会,SOSP 2026;2026年9月29日;捷克共和国布拉格 Bardia Mohammadi 邮箱:[[email protected]](mailto:[email protected]) 隶属机构:马克斯·普朗克软件系统研究所,德国萨尔布吕肯 Laurent Bindschaedler 邮箱:[[email protected]](mailto:[email protected]) 隶属机构:马克斯·普朗克软件系统研究所,德国萨尔布吕肯 © 无 ###### 摘要\. 大型语言模型智能体集群现已产生无法完全撤销的外部效应:它们调动资金、部署代码、删除数据并泄露信息。现有控制机制仅逐一检查效应,因此一个获得独立授权的智能体集群可在共享触发条件下过度消耗其委托方的风险额度,同时每个本地网关仍保持正确。我们提出*不可逆性预算*——一种由可信运行时维护的累积剩余在险价值账户,覆盖委托方、智能体、工作流及租户。将不可逆性视为一等资源,运行时会为每个效应计入其低于智能体层级的剩余损失,并在总和将超额时拒绝边际效应。定价极具挑战,因效应具有异构性、对抗性声明且存在相关性。我们通过受控研究发现:逐效应网关导致集群级超额消费最高可达租户风险限额的48倍,而预算机制能将所有正确计费的运行保持在限额内。保守且依赖感知的定价仍是可部署设计的核心开放问题。 ## 1\.引言 大型语言模型智能体集群现已调用工具、更新持久状态并产生外部效应,其后果可能无法完全逆转。它们调动资金、部署代码、删除数据并泄露信息。管理稀缺或危险的共享资源是操作系统的经典职能——操作系统通过测量内存、CPU时间和I/O带宽,将其分配给委托方,在使用时计费并在竞争时进行防御。智能体操作系统虽处于萌芽阶段(Packer等,2023 (https://arxiv.org/html/2609.00275#bib.bib13);Mei等,2025 (https://arxiv.org/html/2609.00275#bib.bib14)),但所有此类系统都将继承一项当前运行时未管理的任务:智能体集群在外部世界造成的不可逆风险暴露。与内存不同,这是一种依赖于效应本身、补偿方式及其他智能体同时支出的剩余损失。 现有控制机制并未管理此数量。它们仅处理局部问题:有的延迟结算,有的验证任务权限,有的为审核定价,有的为单个行为提供保险(Mohammadi等,2026 (https://arxiv.org/html/2609.00275#bib.bib1);Chen等,2026 (https://arxiv.org/html/2609.00275#bib.bib2);Madras等,2018 (https://arxiv.org/html/2609.00275#bib.bib10);Mozannar与Sontag,2020 (https://arxiv.org/html/2609.00275#bib.bib11);Chen,2026 (https://arxiv.org/html/2609.00275#bib.bib17);Xu等,2026 (https://arxiv.org/html/2609.00275#bib.bib8);Hua等,2026 (https://arxiv.org/html/2609.00275#bib.bib18))。无一保持跨智能体的累积余额。例如,考虑五十个有独立上限的采购智能体,它们监控到同一供应商价格飙升,每个智能体理性地决定立即购买。每笔采购都通过其本地限额,但共同构成了未获审核者批准的七位数头寸。每个行为都被允许,但集群超额消费了。在提交前核算此事非常困难:效应在损失残留方面差异显著,智能体可能误报或拆分效应以规避限额,共享触发器导致的损失相关性会使简单加总的账户方法失效。 我们提出*不可逆性预算*——一种累积剩余在险价值账户,由可信运行时为每个*委托方*维护:可以是智能体、其运行的工作流或拥有它们的租户。核心思想是将不可逆性视为一等资源,如同操作系统处理内存:位于智能体之下的可信运行时为每个效应计入预计在恢复后仍将存在的损失,将其累加至委托方的运行余额,一旦该余额将超过授权预算,即拒绝或上报后续效应。这依次应对了三大难题:为剩余损失(而非面值)定价解决了异构性问题,在智能体之下计费阻止了被攻陷模型通过误报或拆分效应规避限额,单一共享余额使相关性爆发成为可见的超额消费,这是逐效应网关无法察觉的。结果是现有的逐效应控制不再相互独立,而是转变为对单一共享资源的支出策略。实现这一点需要定义该数量及其计费预算的资源模型,以及对其进行定价和预留的运行时,二者均在采购示例(图1 (https://arxiv.org/html/2609.00275#acmlabel1))中展示。 我们通过采购集群的受控模拟、公共智能体追踪分析及账本微基准测试评估该抽象。结果支持了该主张并指出了其局限性。本地网关批准了每笔采购,但集群平均超额消费风险限额2.4倍,在扩展至一千个智能体时甚至达48倍。预算在任何规模下都将所有运行保持在限额内,并且因其按类型为效应定价,在相同安全性下比固定上限允许更多有效工作。其弱点在于定价:当效应类型被误报,或共享触发器导致的损失相关性超出计费假设的独立性时,实际损失仍可能超过账本核算。账本本身开销很低。使计费保持保守并具有依赖感知性是开放问题。 本文有三项贡献:将不可逆风险暴露定义为智能体操作系统的类型化、累积准入数量(§3 (https://arxiv.org/html/2609.00275#S3)),一个结合风险类型化效应、分层预留-确认-取消账本及在险价值准入控制的可信运行时(§4 (https://arxiv.org/html/2609.00275#S4)),以及一个隔离集群级组合故障并证明依赖感知定价为核心开放需求的受控可行性研究(§5 (https://arxiv.org/html/2609.00275#S5))。 三区示意图。左:五十个智能体图标连接至标注“价格飙升”的共享触发器,各自提议采购。中:位于提交边界的可信运行时按剩余损失为每个效应定价,并向共享预算账本计费,账本显示为趋向红色限额线的填充条,拒绝将跨越限额的效应。右:结果条显示本地网关超限2.4倍,而预算保持在限内。 图1\. 运行示例中的不可逆性预算。五十个采购智能体共享一个触发器,各自提议一个本地授权的采购(左)。可信运行时按其剩余损失为每个效应定价,并针对单一共享账本计费,一旦总额将超过租户限额,即拒绝边际效应(中)。逐效应网关超额消费2.4倍,预算保持在限内(右)。 ## 2\.背景与动机 #### 运行示例 我们使采购集群具体化并在全文重用。五十个智能体各负责一条产品线,可在单智能体速率限制下下达最高五万美元的供应商订单,租户在一个交易日内容忍二十五万美元的未对冲敞口。在普通日子里,智能体独立购买并远低于此限额。然而,考虑一个共享触发器:供应商价格飙升警报使得“立即购买”对所有智能体同时变得合理。这些是§5 (https://arxiv.org/html/2609.00275#S5)评估所模拟的参数。 #### 普适性 此故障并非采购特有。凡智能体改变外部世界的领域均可能出现:薪资运行、基础设施自动化、数据删除、客户沟通及事件响应。这些领域的操作者已通过配额、审批权限和柜面级风险控制来限制稀缺或风险数量,正是因为本地权限从未意味着总体安全。智能体集群以更高速度和更弱委托方边界重现了这一压力,将操作者的问题从行为是否被允许转变为在下一次提交前还有多少不可逆风险暴露剩余。 #### 仅计数不足 回答此问题需为效应定价而非计数。在示例中,取消的草案订单、完成的供应商订单和签署的长期合同在补偿、恢复和撤销均耗尽后,携带的剩余损失差异巨大。将每个效应视为一单元的控制机制若低估不可逆效应则不安全,若将它们全部视为最大值则过于保守而不可用。可逆性是定价中的一个维度,而非二元门控。 #### 差距 现有系统逐效应运作。表1 (https://arxiv.org/html/2609.00275#S2.T1)列出最接近的机制:Atomix延迟结算直至安全(Mohammadi等,2026 (https://arxiv.org/html/2609.00275#bib.bib1)),Cordon在释放前验证任务权限(Chen等,2026 (https://arxiv.org/html/2609.00275#bib.bib2)),精算网关如AAI为单一轨迹报价并绑定资本(Chen,2026 (https://arxiv.org/html/2609.00275#bib.bib17)),护栏和数据丢失防护验证载荷(OWASP Gen AI安全项目,智能体安全倡议,2025 (https://arxiv.org/html/2609.00275#bib.bib15)),sagas提供补偿路径(Garcia-Molina与Salem,1987 (https://arxiv.org/html/2609.00275#bib.bib3);Helland,2007 (https://arxiv.org/html/2609.00275#bib.bib4))。每个都很好地回答了其局部问题,但无一保持能在示例中捕捉集群行为的累积、跨智能体余额。缺失的是一个跨越智能体、工作流和租户的提交前账户。 表1\. 现有机制控制局部效应或领域特定计数器,但无一维护异构的跨智能体风险暴露账户。 #### 三项要求 提交前账户面临三项困难,每项都排除更简单的设计。异构效应排除面值集体限额——该方式对取消草案和签署合同同等计费,仅在过于保守且无用时才安全。对抗性智能体排除信任声明计费——被攻陷的工具可将一个大订单拆分为多个低于限额的子订单,或误报设定计费的效应类型。共享驱动因素排除独立计费求和——因为一个价格飙升警报或提示注入会使许多智能体选择相同的不可逆效应。因此,可部署控制必须在提交前核算、规范化类型并为依赖性定价。 ## 3\.资源模型 §2 (https://arxiv.org/html/2609.00275#S2)论证集群需要一个定价效应、跨越委托方并将相关性风险暴露视为整体的提交前账户。本节将该账户定义为资源。包含三部分:效应的计费、委托方支出的预算以及驱动准入的风险压力信号。 #### 不可逆风险暴露 对于外部受影响方,定义其计费c(e)为可用补偿、恢复和撤销应用后,配置时限内的剩余损失。效应结果是随机的,因此运行时按置信水平计费:cγ(e)是定价组件提供的剩余损失分布的γ分位数。计费在金融领域是标量,当资金、数据丢失、可用性和法律风险无法归约为通用单位时则为向量。可逆性(Garcia-Molina与Salem,1987 (https://arxiv.org/html/2609.00275#bib.bib3))作为多个坐标之一进入价格,而非充当二元门控。 #### 不可逆性预算 每个委托方p被分配一个窗口化预算Bp,运行时维护针对其的已预留加已提交风险暴露余额。不变式很简单:当边际计费将在所需置信水平上超过其预算时,委托方不得外部化效应。在运行示例中,五十个智能体各自在其自身分配、工作流及租户的二十五万美元额度内支出,因此没有智能体的本地自由度能超额消费集群的上限。预算由预算权限按设定的时限补充:短时限约束突发,长时限约束周期性活动。 #### 风险压力 我们将此消耗信号称为*风险压力*,类似于内存压力:如同内核在可用内存不足时回收页面并节流,运行时在可用预算下降时收紧准入,并在极端情况下冻结外部化(§4 (https://arxiv.org/html/2609.00275#S4))。风险压力是调度信号而非安全证明,将固定的每次调用判决转变为针对稀缺数量的控制回路。 ## 4\.运行时 资源模型定义了计费内容,运行时是执行计费的机制。其任务是在效应提交前使其风险暴露可观察,防止集群对同一预算进行双重支出,并在预算不足时决定准入。以下机制满足这些任务,每项都是移至智能体信任边界之下的现有原语,因此被攻陷的模型既无法定价也无法悄悄支出自身风险。 #### 风险类型化效应 为使风险暴露在提交前可观察,工具规范声明效应类别、风险暴露上限、可逆路径、补偿机制、权限要求及依赖提示。现有可逆、可补偿和不可逆效应分类法提供了初始类型结构(Garcia-Molina与Salem,1987 (https://arxiv.org/html/2609.00275#bib.bib3))。定价位于智能体之下,因此计费cγ(e)来自规范和可信定价服务,而非模型;计费本身仅与规范作者及其审计员同等可信。许多领域已在审批规则、云配额和保留策略中编码了此信息的部分版本,运行时使这些隐式控制在提交边界可执行。 #### 规范化 计费的可靠性取决于其读取的类型,因此运行时自行分配该类型,而非接受调用者提供的类型。可信注册表将每个效应类别与其标识证据绑定:调用工具的身份和签名规范、调用解析到的API端点及请求模式、以及后续确认实际发生的结算回执。因此,一个被攻陷的工作流可能提议最终转账,但无法声明该转账可退款,因为它从未提供标签。注册表无法解析的内容按最贵的匹配类别计费,因此未识别的效应会被节流而非静默准入。可信基础比账本更宽:注册表
相似文章
令牌预算:63起LLM智能体预算超支事件的实证目录,以及基于仿射类型Rust缓解方案的案例研究
本文呈现了来自21个编排框架的63起经确认的LLM智能体预算超支事件的实证目录,按故障分类法组织,并介绍了一个使用仿射类型所有权的Rust crate,在编译时而非运行时防止令牌/成本预算违规。
LLM交易代理中的表示特征与风险反馈对齐
本文研究了LLM代理在金融交易中的行为对齐与表示动态,介绍了TradeArena测试平台,并发现规划嵌入中存在可测量的故障前特征,这些特征能在多种前沿模型与压力条件下高精度预测回撤。
通过Rockafellar-Uryasev共形推断实现条件风险价值的对抗鲁棒控制
本文提出了一种在线、无分布假设的框架,用于在对抗性和非平稳环境中控制条件风险价值(CVaR),具有渐近保证,并在投资组合风险管理和大型语言模型(LLM)毒性缓解中具有应用。
@alex_prompter:用风险等级来门控AI代理的行动是错误的。可逆性才是正确的。大多数权限系统……
AI代理权限系统的一个设计原则:用可逆性而非风险来门控行动,包括自主性阶梯、可逆性标签,以及针对不可逆行动的无条件强制函数。
Adaptive Finite-Budget Training for CVaR Risk-Aware Q-Learning
This paper proposes an adaptive training controller for CVaR risk-aware Q-learning, improving finite-budget behavior, reducing Bellman residuals by ~85%, and yielding better risk-adjusted performance in daily Bitcoin trading.