OpenAgentFlow: 为异构AI代理机队实现系统级安全边界

arXiv cs.AI 论文

摘要

OpenAgentFlow 提出了一种新架构,用于在异构AI代理机队中实现系统级安全执行,通过统一的动作流和预执行策略执行来确保安全操作。

arXiv:2609.00015v1 公告类型:新 摘要:由大语言模型驱动的AI代理正从孤立的助手演变为异构系统,其中多个代理、规划器、控制器和执行后端在相同的用户或企业环境中运行。在这种设置中,安全成为系统级的动作治理问题:在具体代理生成的动作修改共享状态之前,决定是否提交这些动作。现有保障措施涵盖提示、工具调用、GUI动作和代理本地行为,但往往使执行分散,模糊了跨多步动作流中出现的风险,并且对可审计性和策略演进的支持有限。 我们提出了OpenAgentFlow,一种控制平面/动作平面架构,在动作提交边界执行安全。它将待处理的GUI动作、API调用、工具调用和LLM生成的调用规范化为统一的AgentEvent流,将每个事件路由到共享的预执行策略执行点,并在控制平面中维护出处、会话状态、审计记录和可更新策略。这创建了一个共享的可治理动作流,并允许新规则生效而无需修改代理、提示、模型或执行路径。 我们在Android上实例化了OpenAgentFlow。在一个包含300个案例的动作事件基准测试中,它达到了94.0%的准确率和95.3%的攻击拦截率。在一个包含30个案例的动态策略套件中,在安装新规则后,它在27个案例中匹配了预期行为。在来自100个案例的Android模拟器套件中,针对98个跟踪案例,它在GUI、API和LLM规划案例中达到了90.8%的原始准确率和92.9%的跟踪调整通过率。这些结果表明,OpenAgentFlow为异构AI代理机队提供了实用的共享执行边界。
查看原文
查看缓存全文

缓存时间: 2026/09/02 05:55

# OpenAgentFlow:为异构AI智能体集群实现系统级安全边界
来源:https://arxiv.org/html/2609.00015  
作者:董胜晓、赵翔宇  
单位:香港城市大学  
单位:中国香港  
姚鑫  
单位:岭南大学  
单位:中国香港  
韦笑涛*(通讯作者)  
单位:南方科技大学  
单位:中国深圳  
邮箱:[[email protected]](mailto:[email protected])

###### 摘要
AI智能体(越来越由大语言模型驱动)正从孤立的助手演变为异构智能体系统——其中多个智能体、规划器、控制器和执行后端在相同的用户或企业环境中运作。在这些系统中,安全问题转化为一个系统级的动作治理问题:决定智能体生成的具体动作是否应在更改共享状态前被提交执行。现有安全防护措施覆盖了有用的邻近层,包括提示词、工具调用、图形界面操作和智能体本地行为,但它们留下了三个系统级缺口:跨异构智能体、执行器和端点的碎片化执行;仅在多步骤会话中才会显现风险的不透明组合动作流;以及决策、溯源和更新分散在本地组件时,可审计性与策略演进能力的薄弱。

我们提出OpenAgentFlow,一种全新的控制面/动作面治理架构,用于在动作提交边界执行安全策略。OpenAgentFlow将待处理的图形界面操作、API调用、工具调用和LLM生成的调用规范化为统一的`AgentEvent`流,将每个事件路由至共享的执行前策略执行点,并在控制面维护执行观测溯源、会话状态、审计记录和可更新策略。该设计将碎片化的执行路径转化为可治理的共享动作流,在提交前暴露组合动作流风险,并将策略决策与审计证据关联,同时允许新规则在不改变智能体、提示词、模型或执行路径的情况下生效。

我们在Android平台上实例化OpenAgentFlow,并通过动作事件基准测试、动态策略测试和真实模拟器运行进行评估。300个案例的动作事件基准测试获得94.0%的准确率和95.3%的攻击拦截率;30个案例的动态策略测试在安装新控制面规则后,有27/30个案例符合预期行为;在100个案例的Android模拟器套件中,针对98个被追踪案例,OpenAgentFlow在图形界面、API和LLM规划案例上达到90.8%的原始准确率和92.9%的追踪调整通过率。这些结果共同表明,OpenAgentFlow为AI智能体集群提供了一个实用的共享执行边界,统一了动作治理,暴露了组合动作流风险,并在动作影响共享用户环境前支持可追责的策略演进。

## 1 引言
AI智能体(越来越由大语言模型驱动)不再局限于回答问题。它们操作图形界面、调用工具、浏览网页、控制桌面并自动化移动应用(25;14;28;23;13;24)。单个任务可能涉及联系人、日历、文件、浏览器状态、支付流程、邮件和系统设置。这些资源通常在智能体、应用程序、工具和服务之间共享,尤其是在智能体系统由多个交互式智能体构建时(22;10;6;5)。在此类系统中,异构性不仅存在于执行层面,也存在于智能体、框架、角色、执行器、端点和状态所有者之间。一个智能体可能从私有端点读取数据,另一个智能体可能将结果转换为中间产物,后续操作可能通过邮件、CRM或其他外部服务发送该产物。

在此背景下,安全性并非由单一的提示词、模型输出、工具调用或智能体本地策略决定。相关对象是智能体即将提交的具体动作,该动作的解释取决于使其成为可能的会话状态。这将执行从智能体本地决策转移到共享的动作提交边界。

多智能体场景最清晰地展示了这一问题。在共享业务任务中,会计智能体可能通过薪资API读取薪资数据,财务智能体可能在预算报告中使用该汇总数据,而销售智能体随后可能通过CRM或邮件将该报告发送给外部客户。每个步骤都符合执行它的智能体的本地角色:收集数据、准备报告或与客户沟通。策略违规仅在整体查看会话时显现。源自薪资的信息通过一系列普通操作从私有来源转移到了外部输出端。无需任何智能体怀有恶意,也无需单个提示词包含完整风险。单智能体端点链是同一问题的简化形式。助手可能从通讯录读取Alice的电话号码以协助安排会议,将该号码写入日历事件的备注字段,随后通过邮件发送会议详情。单独来看,读取联系人、更新会议和发送邮件都是正常操作。它们的组合将源自联系人的数据从私有端点转移到了非预期的输出端。

> 图注:图1:会话级动作风险源于组合动作流。多个智能体可能通过共享会话传播敏感溯源,而单个智能体可能跨多个端点实例化相同风险。在两种情况下,不安全条件都出现在组合动作流中,而非任何单一提示词中。

同样的执行缺口不仅限于源到端的数据传播。调度智能体可能调用其范围外的联系人API,被提示注入的网页可能引导后续的支付或删除操作,或图形界面控制智能体可能在达到任何可执行检查点前提交高影响操作。这些仍然是动作级风险。伤害发生在预期动作被提交时,而非模型生成文本时。

现有防御措施覆盖了有用的邻近层,包括针对提示词、工具调用、图形界面操作和智能体本地行为的防护栏。然而,它们未能完全解决当AI智能体系统跨异构智能体、执行器、端点、共享状态和多步骤工作流运作时产生的系统级治理问题。缺失的抽象是共享执行对象:即将提交的具体动作的表示,以及使该动作具有策略相关性的会话状态和溯源。

此执行环境产生了三个系统级动作治理风险:
1.  **碎片化的动作治理边界**:AI智能体系统由专用智能体、图形界面控制器、API包装器、工具后端、提示词规则和LLM规划调用组装而成。每个组件都暴露了定义策略、执行决策和收集日志的不同位置。因此,治理分散在本地各处,使策略脆弱、不一致,且难以应用于整个智能体系统。
2.  **不透明的会话级动作流风险**:动作的风险通常取决于会话如何到达该动作。从通讯录读取的值可能稍后出现在日历中,然后通过邮件发送;源自薪资的信息可能在到达外部客户前经过报告。每个步骤对执行它的组件而言可能看似合法,而组合工作流却违反了策略。缺失的对象不是对每个内部模型决策的解释,而是对策略相关动作历史的共享执行视图。
3.  **薄弱的系统级可追责性与策略演进**:当策略分散在智能体、提示词、工具、应用程序和本地包装器中时,很难确定哪条规则治理了某个动作、哪些先验观察支持了该决策、为何动作被允许或拒绝,以及后续策略更新是否在跨执行路径时一致地改变了行为。这削弱了可审计性,使策略调试复杂化,并使治理难以随时间验证。

这些风险使动作提交边界成为调解智能体执行的自然位置。在此点,系统仍可检查待处理的动作、其目标端点、其载荷以及迄今为止累积的会话状态,然后才能更改用户或企业状态。

我们引入OpenAgentFlow,一种新的控制面/动作面治理架构,将共享的策略执行点置于此边界。关键创新在于OpenAgentFlow治理的是规范化的智能体生成动作流,而非提示词、模型输出、智能体本地策略或端点特定工具模式。图形界面操作、API调用、工具调用和LLM规划调用被转换为统一的`AgentEvent`,并由相同的预执行执行路径检查。治理状态存在于智能体之外。控制面维护策略、执行观测溯源、审计记录、会话状态和规则更新,而动作面将策略执行点置于执行路径上。这种分离解决了上述三个风险:共享的策略执行点减少了碎片化的执行边界;溯源和会话记忆使组合动作流可见;带有可更新规则的审计记录支持可追责的策略演进。

受OpenFlow式策略管理与转发分离(2;12)的启发,该设计允许策略在不重写单个智能体、提示词、模型或执行路径的情况下演进。它还将溯源保持在执行侧:图形界面控制器、工具/API包装器和策略执行点维护的内存提供快速路径使用的证据,而智能体提供的元数据保持为辅助信息。

我们在Android平台上实例化OpenAgentFlow,并通过动作事件基准测试、动态策略测试和真实Android模拟器运行进行评估。300个案例的动作事件基准测试获得94.0%的总体准确率和95.3%的攻击拦截率,而仅提示词建议性措施未拦截任何攻击案例。确定性通用路径轻量高效,T1/T2检查的P99延迟低于1毫秒。30个案例的动态策略测试在安装新控制面规则后,有27/30个案例符合预期行为,包括在不改变智能体、模型、提示词或执行路径的情况下拒绝所有核心匹配动作。在100个案例的Android模拟器套件中,针对98个被追踪案例,OpenAgentFlow在图形界面、API和LLM规划案例上达到90.8%的原始准确率和92.9%的追踪调整通过率。同一治理层覆盖了动作事件基准测试、策略更新、多智能体传播和真实Android执行。

本文贡献如下:
- • 我们提出OpenAgentFlow,一个面向异构AI智能体集群的全新系统级治理层。OpenAgentFlow提供共享的动作提交控制点,在图形界面操作、API调用、工具调用和LLM规划调用影响共享用户或企业环境之前进行调解。
- • 我们将智能体系统安全表述为系统级动作治理问题,并确定动作提交边界为仍可调解预期动作的点。我们引入`AgentEvent`,一个统一的表示,使该边界在图形界面、API、工具和LLM规划执行路径间保持框架无关性。
- • 我们设计了控制面/动作面架构,用于在共享的`AgentEvent`流上执行策略。它结合了共享的预执行策略执行点、执行观测溯源和会话记忆、审计记录、可更新的`FlowRule`以及分阶段的T1–T4流水线,从而统一执行、暴露会话级动作流并支持可追责的策略演进。
- • 我们在Android平台上实例化OpenAgentFlow,并通过离线动作事件套件、动态策略测试、威胁与溯源压力案例以及真实模拟器运行进行评估。结果表明,预执行调解能够阻止仅提示词建议机制和本地防护栏未能防止的会话级动作风险。

## 2 相关工作
先前的防护措施通常将策略附加到本地表面:提示词、工具包装器、图形界面控制器或智能体运行时。这些边界虽有用,但未能提供跨异构动作路径、会话级价值移动和跨智能体策略决策的统一视图。以下相关工作围绕这些边界组织;OpenAgentFlow使用共享的跨通道动作流作为执行对象。

#### 行动智能体与图形界面/移动基准测试。
基于LLM的智能体越来越多地将推理与工具调用、网页导航、桌面控制和移动图形界面操作等动作结合。早期工作如ReAct和Toolformer表明语言模型可以将推理与外部动作或工具使用交替进行(25;14)。近期基准测试将此设置扩展到真实的网页、桌面和移动环境,包括WebArena、OSWorld、AndroidWorld和AndroidLab(28;23;13;24)。其他移动和图形界面基准测试进一步强调真实的设备控制任务和安全相关副作用(15;21;9)。多智能体框架如AutoGen、CAMEL、MetaGPT和AgentScope表明智能体系统正越来越多地由多个交互式智能体组成(22;10;6;5)。SWARM在交互分布层面研究多智能体治理,使用软性概率标签来量化不同治理手段下的安全与福祉权衡(1)。这些系统和基准测试推动了我们的研究背景:智能体不再是纯文本助手,其动作可能影响共享用户环境。我们使用“AI智能体系统”来强调执行环境而非特定模型接口:相关对象是可能影响共享环境的智能体生成动作。OpenAgentFlow不是能力基准测试;它研究的是这些动作应在何处被调解。

#### 提示注入与使用工具的智能体安全。
使用工具的智能体易受间接提示注入攻击,即工具返回的不受信任内容或检索文档引导后续操作偏离用户意图。先前工作形式化了提示注入攻击与防御,并评估了工具集成智能体在此类攻击下的表现(11;26;3)。后续攻击、基准测试和防御措施探讨了自适应注入、工具介导的妥协、因果接管和上下文净化(18;27)。

相似文章

AgentWall:面向本地AI代理的运行时安全层

arXiv cs.AI

本文介绍了AgentWall,一个面向本地AI代理的运行时安全层。它能在执行前拦截操作、执行声明性策略、对敏感操作要求人工审批,并记录防篡改的操作轨迹。该项目开源,支持多个代理平台。

AgentBound: 自主AI智能体的可验证行为治理

arXiv cs.AI

AgentBound提出了一种运行时治理框架,用于自主AI智能体,通过并行组合委托授权、行为章程和站点行动合约来强制执行可验证的行为监督,并生成密码学可验证的收据。

构建AI代理工具调用的开源执行层

Reddit r/AI_Agents

介绍Faramesh,一个开源运行时执行层,用于AI代理工具调用,在操作执行前检查策略,提供超越可观测性或LLM评判的解决方案。