受限代理:多代理AI系统的委托安全

Hugging Face Daily Papers 论文

摘要

本文介绍了Agentic Principal Chain(APC),这是一个针对多代理AI系统的安全框架,它强制执行会话感知的授权,以防止委托滥用和有害行为组合,在评估中显示出显著的风险降低。

基于LLM的代理可以代表用户访问云服务、调用工具或调用其他代理。在会话开始时,代理的权限被设置但保持静态,每个请求独立评估,不考虑先前操作。在其权限范围内,代理可能执行与委托任务相悖的操作,将单独允许的操作组合成禁止的结果,或将权限委托给子代理而不加以限制。提示注入只有在代理有权限执行此类操作时才构成风险;因此,这是一个授权架构问题,而不仅仅是模型问题。 Agentic Principal Chain(APC)跟踪从一个主体到下一个主体的委托权限。APC使用六项授权检查对每个请求进行评估,基于累积的会话状态。APC传递并限制委托的范围和预算。使用组合闭包,APC检查请求是否与先前操作相矛盾,以防止禁止的组合,并在模型外部强制执行决策。 我们证明了APC实现的Blast Radius Monotonicity和Composition Soundness;Composition Soundness仅限于在完整限制集和序列化准入下的禁止组合。我们评估了3,154个实例,包括InjecAgent、AgentDojo和ASB。我们的受损模型评估通过在第一个合法工具调用后插入真实攻击调用来独立于模型行为测试APC。AgentDojo的数据泄露从所有四个领域的75-100%降至0%;APC阻止了所有544个InjecAgent数据窃取案例。意图绑定将破坏从38.6%减少到4.0%,操纵从90.5%减少到12.1%。在空闲主机上,授权延迟在第99个百分位为0.24毫秒;在949个AgentDojo任务注入对中,效用在两个设置中分别降低了8.6和13.9个百分点。实现、评估工具和数据均公开可用。
查看原文
查看缓存全文

缓存时间: 2026/08/20 20:06

论文页面 - 有界代理:多智能体AI系统的委托认证安全

来源:https://huggingface.co/papers/2608.15888

摘要

代理主链通过会话感知的授权检查机制,防止大型语言模型代理中出现有害操作组合与委托滥用行为。

基于大型语言模型的代理可代表用户访问云服务、调用工具或触发其他代理。在会话启动时,代理权限虽被设定但保持静态,且每次请求独立评估,不参考先前行为。在权限范围内,代理可能违背委托任务行事,将单个允许的操作组合成禁止的结果,或将权限委托给次级代理而不限制其范围。提示词注入风险仅在代理具备执行此类操作的权限时才会构成威胁——因此这属于授权架构问题,而不仅是模型本身的问题。代理主链可追踪从一个委托主体到下一个的权限流转,通过六项授权检查评估每个请求,并依据累积的会话状态进行判断。代理主链会持续传递并限制委托范围与预算额度,通过组合闭包机制检查请求与历史操作的关系以阻止被禁止的组合行为,并在模型外部实施决策。我们证明了代理主链实现具备爆炸半径单调性与组合健全性;其中组合健全性仅适用于完全限制集与序列化准入下的被禁止操作组合。本次评估涵盖3,154个实例,包括InjecAgent、AgentDojo和ASB测试集。通过在首次合法工具调用后插入真实攻击调用,我们在独立于模型行为的条件下评估了受损模型的表现:AgentDojo数据泄露率在所有四个领域从75-100%降至0%;代理主链拦截了全部544例InjecAgent数据窃取案例。意图绑定机制将破坏性行为发生率从38.6%降至4.0%,将操纵行为发生率从90.5%降至12.1%。在空闲主机上,授权延迟在第99百分位为0.24毫秒;在949组AgentDojo任务注入配对测试中,效用指标分别下降了8.6和13.9个百分点。实现方案、评估工具及数据集均已开源。

查看arXiv页面 (https://arxiv.org/abs/2608.15888) 查看PDF (https://arxiv.org/pdf/2608.15888) 项目页面 (https://muruaga.ai/bounded-agents/evaluation) GitHub2 (https://github.com/xmuruaga/bounded-agents) 添加至论文集 (https://huggingface.co/login?next=%2Fpapers%2F2608.15888)

在代理工具中获取本论文:

hf papers read 2608\.15888

尚未安装最新CLI工具?运行以下命令安装:curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型

暂无模型引用本文

在模型README.md中引用 arxiv.org/abs/2608.15888 即可从本页链接。

引用本文的数据集

暂无数据集引用本文

在数据集README.md中引用 arxiv.org/abs/2608.15888 即可从本页链接。

引用本文的空间

暂无空间引用本文

在空间README.md中引用 arxiv.org/abs/2608.15888 即可从本页链接。

包含本文的论文集

暂无论文集包含本文

将本文添加至论文集 (https://huggingface.co/new-collection) 即可从本页链接。

相似文章

用于关键基础设施中自主AI系统的去中心化细粒度访问控制

arXiv cs.AI

本文提出了一种面向关键云基础设施中自主AI代理的去中心化多层访问控制架构,引入了复合身份模型、分层权限、去中心化策略所有权以及渐进式信任升级。该架构已在某主要云服务商部署,在八个月内实现了零未授权写操作。

AgentBound: 自主AI智能体的可验证行为治理

arXiv cs.AI

AgentBound提出了一种运行时治理框架,用于自主AI智能体,通过并行组合委托授权、行为章程和站点行动合约来强制执行可验证的行为监督,并生成密码学可验证的收据。

子代理不应自动继承父代理的权限

Reddit r/AI_Agents

本文主张AI子代理不应自动继承其父代理的全部权限,而是提倡采用明确范围、工具限制和审计跟踪的弱化委托方式,以增强多代理系统的安全性。