受限代理:多代理AI系统的委托安全
摘要
本文介绍了Agentic Principal Chain(APC),这是一个针对多代理AI系统的安全框架,它强制执行会话感知的授权,以防止委托滥用和有害行为组合,在评估中显示出显著的风险降低。
查看缓存全文
缓存时间: 2026/08/20 20:06
论文页面 - 有界代理:多智能体AI系统的委托认证安全
来源:https://huggingface.co/papers/2608.15888
摘要
代理主链通过会话感知的授权检查机制,防止大型语言模型代理中出现有害操作组合与委托滥用行为。
基于大型语言模型的代理可代表用户访问云服务、调用工具或触发其他代理。在会话启动时,代理权限虽被设定但保持静态,且每次请求独立评估,不参考先前行为。在权限范围内,代理可能违背委托任务行事,将单个允许的操作组合成禁止的结果,或将权限委托给次级代理而不限制其范围。提示词注入风险仅在代理具备执行此类操作的权限时才会构成威胁——因此这属于授权架构问题,而不仅是模型本身的问题。代理主链可追踪从一个委托主体到下一个的权限流转,通过六项授权检查评估每个请求,并依据累积的会话状态进行判断。代理主链会持续传递并限制委托范围与预算额度,通过组合闭包机制检查请求与历史操作的关系以阻止被禁止的组合行为,并在模型外部实施决策。我们证明了代理主链实现具备爆炸半径单调性与组合健全性;其中组合健全性仅适用于完全限制集与序列化准入下的被禁止操作组合。本次评估涵盖3,154个实例,包括InjecAgent、AgentDojo和ASB测试集。通过在首次合法工具调用后插入真实攻击调用,我们在独立于模型行为的条件下评估了受损模型的表现:AgentDojo数据泄露率在所有四个领域从75-100%降至0%;代理主链拦截了全部544例InjecAgent数据窃取案例。意图绑定机制将破坏性行为发生率从38.6%降至4.0%,将操纵行为发生率从90.5%降至12.1%。在空闲主机上,授权延迟在第99百分位为0.24毫秒;在949组AgentDojo任务注入配对测试中,效用指标分别下降了8.6和13.9个百分点。实现方案、评估工具及数据集均已开源。
查看arXiv页面 (https://arxiv.org/abs/2608.15888) 查看PDF (https://arxiv.org/pdf/2608.15888) 项目页面 (https://muruaga.ai/bounded-agents/evaluation) GitHub2 (https://github.com/xmuruaga/bounded-agents) 添加至论文集 (https://huggingface.co/login?next=%2Fpapers%2F2608.15888)
在代理工具中获取本论文:
hf papers read 2608\.15888
尚未安装最新CLI工具?运行以下命令安装:curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型
暂无模型引用本文
在模型README.md中引用 arxiv.org/abs/2608.15888 即可从本页链接。
引用本文的数据集
暂无数据集引用本文
在数据集README.md中引用 arxiv.org/abs/2608.15888 即可从本页链接。
引用本文的空间
暂无空间引用本文
在空间README.md中引用 arxiv.org/abs/2608.15888 即可从本页链接。
包含本文的论文集
暂无论文集包含本文
将本文添加至论文集 (https://huggingface.co/new-collection) 即可从本页链接。
相似文章
叠加治理:面向代理型AI的委托与范围组合式授权框架
本文提出一种面向代理型AI系统的组合式授权框架,引入了委托、范围衰减及递归权限链等原语,以治理自主AI代理。
多智能体人工智能系统中的授权传播:将身份治理作为基础设施
本文引入了“授权传播”这一多智能体人工智能系统中独特的安全挑战,并提出必须将身份治理视为基础设施,以在自主智能体交互中维持授权不变量。
用于关键基础设施中自主AI系统的去中心化细粒度访问控制
本文提出了一种面向关键云基础设施中自主AI代理的去中心化多层访问控制架构,引入了复合身份模型、分层权限、去中心化策略所有权以及渐进式信任升级。该架构已在某主要云服务商部署,在八个月内实现了零未授权写操作。
AgentBound: 自主AI智能体的可验证行为治理
AgentBound提出了一种运行时治理框架,用于自主AI智能体,通过并行组合委托授权、行为章程和站点行动合约来强制执行可验证的行为监督,并生成密码学可验证的收据。
子代理不应自动继承父代理的权限
本文主张AI子代理不应自动继承其父代理的全部权限,而是提倡采用明确范围、工具限制和审计跟踪的弱化委托方式,以增强多代理系统的安全性。