自主拓扑突变:基于能力、状态和影子不变量的多智能体LLM系统安全运行时重构

arXiv cs.AI 论文

摘要

本文介绍了自主拓扑突变(ATM),这是一种针对多智能体LLM系统的运行时机制,能够检测智能体过载,并利用形式化不变量安全地重构团队拓扑。在DeepSeek-V3上的实证结果表明,在保持安全约束的同时,代码任务成功率大幅提升。

arXiv:2607.20488v1 公告类型:新 摘要:多智能体LLM框架通常在启动时固定其团队拓扑。当某个智能体在运行时过载时,例如混合了太多动作类别、累积工具错误或排队等待过多调用,系统没有机制进行自我重构。我们引入了自主拓扑突变(ATM),一种针对多智能体LLM框架的运行时团队突变机制。ATM结合了遥测驱动的过载检测与三个安全不变量,每个结构变化都需通过这三个不变量的门控:能力单调性、状态路由完整性和影子先于实时验证。 ATM监控一个六信号瓶颈指数,包括队列深度、上下文颠簸、工具错误率、角色熵、重试循环率和跨智能体等待时间。当经过预热校准的阈值连续多个时间点被超过时,ATM将过载的智能体分解为专门的子智能体,并将父智能体热切换到协调者角色,同时保留其外部身份。状态传输由隐私级别感知路由控制:每个记忆原子只路由到允许的子集,或明确丢弃并记录原因。没有候选拓扑在通过影子验证窗口之前接收实时流量。 在720次基于DeepSeek-V3驱动的任务运行中,使用确定性工具存根,在四种消融条件和三种工作负载下,ATM分解器将代码任务成功率从3.3%提升至61.7%。完整的轨道和蒸馏系统将正则表达式分类器下检测到的高隐私内存暴露事件从每个任务2.0次降至0.0次,同时保持任务质量。携带ATM不变量的运行时轨道在智能体热路径上增加了不到500微秒的p99延迟。包含一个使用真实Python执行的小型实时工具探测作为外部有效性检查。实现、基准测试工具和追踪记录已开源。
查看原文
查看缓存全文

缓存时间: 2026/07/24 05:02

# 面向多智能体大语言模型系统的安全运行时重构:能力、状态与影子不变量

来源:https://arxiv.org/html/2607.20488 \(2026\)

###### 摘要。

多智能体大语言模型框架在启动时固定其团队拓扑结构。当单个智能体在运行时过载——混合过多动作类别、积累工具错误、或排在太多调用之后——系统没有机制进行重构。我们引入了**自主拓扑突变** \(ATM\),一种用于多智能体大语言模型框架的运行时团队突变机制,它结合了遥测驱动的过载检测与三个形式化安全不变量,每个结构变更均受其约束。ATM持续监控一个包含角色熵项在内的六信号**瓶颈指数**;当经过预热校准的阈值在连续K个滴答中被突破时,它将过载的智能体分解为专门的子智能体,并将父智能体热交换为协调者角色。三个形式化不变量控制突变:I1(子智能体的能力 ⊆ 父智能体的能力)、I2(每个状态原子仅路由到PL允许的目标集合,或显式丢弃并记录原因)、I3(没有成功影子测试则无实时变更)。在720次DeepSeek-V3驱动的任务运行中(两个独立种子运行,各360次试验,使用确定性工具存根以保证可复现性),涵盖四种消融条件和三种工作负载,ATM**因子分解器拆分**将代码任务成功率从3.3%提升至61.7%(+58个百分点,p < 10^{-10});添加角色条件状态蒸馏在安全敏感工作负载上保持了48.3%的成功率(与A0相比无显著退化,p=1.00)。完整的护栏+蒸馏系统在我们基于正则表达式的分类器检测下,将PL ≥ 3的内存暴露从每任务2.0个事件降至0.0个事件;蒸馏进一步减少了每个子智能体的暴露面和高度PL重复。承载ATM不变量的护栏在智能体热路径上增加了不到500微秒的p99延迟。基准测试使用确定性工具存根以保证可复现性;包含一个带有真实Python执行的小型实时工具探查作为外部有效性验证。ATM作为一组DeepAgentRail子类实现,用于开放的jiuwen运行时;实现、基准测试工具和跟踪记录均已开源¹。多智能体系统、大语言模型智能体、运行时拓扑突变、智能体因子分解、能力单调性、人工智能安全

††会议:arXiv预印本;2026年;††期刊年:2026年;††版权:无;††CCS:计算方法 多智能体系统;††CCS:计算机系统组织 分布式架构;††CCS:安全与隐私 信息流控制

## 1. 引言

多智能体大语言模型框架——AutoGen (Wu等人,2023)、MetaGPT (Hong等人,2023)、CrewAI (Moura, 2024)以及我们构建所依赖的开放jiuwen运行时——已经使得组建专门智能体的小型团队协作完成复杂任务成为常规。然而,在所有这些系统中,团队拓扑结构在**启动时是固定的**:操作员指定存在多少智能体、每个智能体拥有哪些工具以及它们如何通信。一旦系统运行,结构便是静态的。实际上,这产生了一类单一智能体优化无法修复的故障模式。为研究工作负载配置的智能体可能突然开始接收代码调试任务;为一种输出模式配置的智能体可能发现自己需要处理需要三种输出模式的会话;其内存范围限定于公共引用的智能体可能继承一个充满API密钥的会话。每种情况下,症状都一样:单个智能体被要求同时混合太多动作类别,其工具调用成功率崩溃,而框架除了失败任务或用Reflexion风格 (Shinn等人,2023) 的自我批评循环掩盖失败外,别无他法。

我们引入了**自主拓扑突变** \(ATM\),一种用于多智能体大语言模型框架的运行时团队突变机制,它结合了遥测驱动的过载检测与三个形式化安全不变量,每个结构变更均受其约束。ATM持续监控一个包含角色熵项在内的六信号**瓶颈指数**;当经过预热校准的阈值在连续K个滴答中被突破时,它将过载的智能体分解为专门的子智能体,并将父智能体热交换为协调者角色。三个形式化不变量控制突变:I1(子智能体的能力 ⊆ 父智能体的能力)、I2(每个状态原子仅路由到PL允许的目标集合,或显式丢弃并记录原因)、I3(没有成功影子测试则无实时变更)。

**为何不变量重要。** 没有I1,运行时突变可能静默授予子智能体其父智能体从未拥有的特权——这正是动机静态权限系统的故障模式。没有I2,蒸馏可能使高敏感度内存原子对多个子智能体可见,更糟的是完全丢弃它们。没有I3,触发失误可能在任务中途将工作正常的智能体交换为更差的配置。遥测驱动的触发与这三个不变量的组合,正是区分可部署的运行时突变机制与临时拓扑重写器的关键。

**贡献。**
- • **C1.** 我们提出了瓶颈指数,一种六信号过载检测器,结合了队列深度、上下文抖动、工具错误率、角色熵、重试循环率和跨智能体等待时间,并采用预热快照τ校准以避免持续过载下的自我强化漂移。
- • **C2.** 我们提出了ATM,一个运行时拓扑突变流水线,将过载智能体分解为专门子智能体,按信任级别蒸馏父智能体的内存,将父智能体热交换为协调者,并在提交前通过5任务影子窗口验证变更。
- • **C3.** 我们定义了任何可部署的运行时拓扑突变必须满足的三个形式化不变量(I1能力单调性,I2状态路由完整性,I3影子优先于实时),并展示了每个不变量在我们的实现中如何机械地执行。
- • **C4.** 在720次使用确定性工具存根的DeepSeek-V3驱动任务运行中,涵盖四种消融条件和三种工作负载,展示了ATM拆分将代码任务成功率从3.3%提升至61.7%(p < 10^{-10}),并且完整的护栏+蒸馏系统消除了检测到的PL ≥ 3内存暴露,同时保持了任务质量。承载ATM突变逻辑的护栏在智能体热路径上增加了不到500微秒的p99延迟。端到端ATM生产环境触发跟踪(第6.4节)展示了完整流水线在实际条件下的触发。

## 2. 相关工作

我们根据系统修改自身的内容来组织先前的工作:当前执行路径(自我修复)、智能体技能和知识(自我改进)、或智能体的结构和团队组成(自我进化和动态拓扑)。

#### 自我修复。
Reflexion (Shinn等人,2023) 在任务尝试之间写入口头自我反思;Self-Refine (Madaan等人,2023) 迭代批评和修改智能体的输出;CRITIC (Gou等人,2024) 使用工具验证事实主张并在发现差异时修改。Self-Healing Router (Bholani, 2026) 在工具失败时重新加权图边,使得Dijkstra在不调用大语言模型的情况下重新路由。Constitutional AI (Bai等人,2022) 将自我批评融入训练而非运行时。所有这些都在输出或任务层面进行修复;它们不重构智能体团队本身。ATM正是在这方面不同:它不仅仅修复输出或参数;它在遥测驱动的过载检测和三个形式化不变量下改变智能体团队结构。

#### 自我改进(技能、提示、内存)。
OpenClaw (Steinberger and others, 2026) 和 Hermes Agent (Nous Research, 2026) 让智能体在解决难题后自主编写SKILL.md文档;Hermes还使用GEPA提示演化。JiuwenSwarm的SkillSelfEvolution (openJiuwen contributors, 2025) 使用基于规则的检测器触发大语言模型驱动的技能细化。Auto-Harness Expert (openJiuwen contributors, 2026) 通过离线评估-计划-实施-验证流水线将其扩展到完整的Expert Harness扩展(提示、技能、工具、MCP插件、护栏、角色)。DSPy (Khattab等人,2023) 通过搜索离线编译提示。MemTier (Sidik and Rokach, 2026) 在OpenClaw运行时上使用注意力归因的认知权重更新循环积累分层情节内存。这些都不改变智能体团队的组成。

#### 自我进化(结构、代码)。
Auto-Harness Meta (openJiuwen contributors, 2026) 优化代码库级别文件并提交拉取请求供人类评审。MetaGPT (Hong等人,2023)、AutoGen (Wu等人,2023) 和 CrewAI (Moura, 2024) 在启动时定义多智能体团队拓扑,并且在运行时不对其进行修改。

#### 动态MAS拓扑和角色适应。
2026年不断增长的工作通过几种互补机制在推理时适应MAS拓扑:MetaGen (Wang等人,2026) 编辑角色规范并从可控动态角色池重写执行图;DyTopo (Lu等人,2026) 通过语义查询/键匹配在每个推理轮次重构稀疏有向通信图;TacoMAS (Xu等人,2026) 在测试时以不同时间尺度共同进化拓扑和每个智能体的能力;SkillMAS (Pan等人,2026) 将MAS重构与技能进化耦合。这些系统通常为任务生成或适应通信图。ATM在三个方面不同:(i) 它操作于**已部署的实时智能体**,从运行时遥测检测过载,而不是为每个查询优化图;(ii) 父智能体的外部身份(agent_id和A2A地址)通过协调器包装器在突变后保持不变,因此上游调用者看到连续服务;(iii) 每个结构变更受三个形式化不变量(能力单调性、状态路由完整性、影子优先于实时)约束——这是我们在并发动态拓扑系统中未见过的属性。

#### 隐私和安全辅助工具。
NeMo Guardrails (Rebedea等人,2023) 在提示边界处强制执行策略驱动的大语言模型输入/输出过滤;OpenClaw在安装时通过徽章强制执行每技能信任。ATM的内存蒸馏和护栏组件在内存流水线内跨度级别操作,具有渐进式PL分类和每端点信任强制,这比先前提示边界过滤更细粒度。

#### 自适应软件系统。
经典的Rainbow框架 (Garlan等人,2004) 为传统软件系统建立了基于架构的自适应,具有监控/分析/计划/执行循环。ATM将此谱系扩展到由大语言模型驱动的多智能体系统,并添加了经典自适应文献中不需要的能力和隐私不变量。

## 3. ATM系统架构

ATM是一个闭环拓扑突变系统,设计为在开放jiuwen多智能体运行时内作为一组可插拔的护栏运行。其架构由两个在不同时间尺度上交互的循环组成:一个**战术监控循环**,每滴答更新遥测;以及一个**战略突变流水线**,仅当持续过载超过校准阈值时才触发。

### 3.1. 背景:openjiuwen Rails

开放jiuwen运行时定义了一个DeepAgentRail接口:一个Python对象,带有on_request、on_tool_call和on_memory_read钩子,在每次大语言模型调用前后触发。护栏是有状态的、可组合的,并在智能体的热路径内运行。ATM实现为三个护栏:
- • **ToolRepairRail**:在HARD工具故障时进行有界大语言模型驱动的修复,位于512个标记的隔离上下文窗口中。
- • **MemoryGuardRail**:每跨度隐私级别(PL0–PL4)分类,具有每端点信任强制。
- • **ATMPipeline**(第4节):拓扑突变流水线本身,协调瓶颈指数、因子分解器、蒸馏器、影子验证器和协调器热交换。

#### 两种干预机制。
ToolRepairRail和ATMPipeline共享一个护栏接口,但应用**不同的安全机制**,这由它们的干预范围证明合理。
*在线修复*(ToolRepairRail)。当单个工具调用返回HARD故障时,护栏发出有界的大语言模型修复尝试并在当前任务内重试调用。这是在线修复,因为干预局限于一个工具调用,用户已经在等待当前响应,并且错误修复的最坏结果与没有修复相同:任务失败的方式与没有护栏时相同。没有影子路径,没有验证窗口,也没有提交/回滚机制;修复的结果在同一个任务跟踪的下一行即可观察到。
*影子验证突变*(ATMPipeline)。当瓶颈指数突破阈值时,护栏提出对智能体团队的**结构**变更。这不是在线修复:候选拓扑在影子中运行W个任务,而当前拓扑继续服务用户请求(第4.3节)。需要更强的安全属性,因为错误的突变不仅会失败一个任务——它会降低许多后续任务的质量,直到回滚。提交的W个任务延迟是我们为这种更强保证付出的代价。两种机制之间的选择是干预范围的函数:局部化、立即可观察的故障适用在线修复;结构化、稍后可观察的故障需要影子验证突变。

### 3.2. 战术循环:遥测和瓶颈指数

每个智能体维护其自身遥测的滑动窗口。在每次大语言模型调用时,我们更新六个信号:
- • \(Q_i\):智能体i的瞬时队列深度。
- • \(C_i\):上下文抖动——衡量上下文窗口在轮次之间需要重新组织的频率。
- • \(E_i\):近期窗口内每工具错误率。
- • \(H_i\):**角色熵**——智能体近期历史中调用动作类别的香农熵。执行单一角色(例如纯搜索)的智能体具有低\(H_i\);混合搜索、代码执行、文件I/O和推理的智能体具有高\(H_i\)。
- • \(R_i\):重试循环率——在非致命错误后立即重新调用相同工具的调用比例。
- • \(W_i\):跨智能体等待时间——阻塞在其他智能体响应上的平均时间。

这些组合成标量瓶颈指数:
\( (1) \quad B_i = \alpha Q_i + \beta C_i + \gamma E_i + \delta H_i + \varepsilon R_i + \zeta W_i \)

相似文章

运行时的管理自主性:基于档位的单/多智能体信息物理系统安全与治理

arXiv cs.AI

本文介绍了EntropyRuntime,一个用于单/多智能体LLM驱动及机器人智能体的离散时间控制系统,采用五个执行档位,配备效用门控调度和事件驱动回退,以确保安全、稳定和连续性。它提供了形式化证明,并在一个三智能体UR5机器人装配单元上进行评估,实现了99.6%的异常检测率。

多智能体大语言模型系统中并发异常的验证检测与预防

arXiv cs.LG

本文形式化了多智能体LLM系统中的四种并发异常,机械验证了一个一致性层次结构,并提供了带有有界预防成本的经过验证的Rust运行时,包括对字节跳动deer-flow的修复以及LangGraph中的工具效应重排序的修复。

TeamTR:多智能体LLM协调的信任域微调

arXiv cs.LG

本文发现共享上下文多智能体LLM团队在顺序微调时存在一种结构性失效模式,并将其形式化为复合占位偏移。为此提出了TeamTR,一种信任域框架,通过重采样轨迹并施加每个智能体的散度控制,实现了平均7.1%的性能提升。