指令泄漏:提示组合型智能体系统中的跨模块干扰
摘要
本文形式化了‘组合行为泄漏’(CBL),这是提示组合型智能体系统中的一种故障模式:由于Transformer自注意力机制缺乏模块级隔离,编辑一个提示模块会静默改变其他模块的行为。本文提出了一个可操作的定义、一个可复用的三通道协议,以及在Claude Sonnet 4.6智能体上进行的144次试验的实证证据,发现了亚阈值干扰,这种干扰可能在数千个决策中累积。
arXiv:2606.26356v1 公告类型:新论文
摘要:提示组合型智能体系统的实践者报告了一种反复出现的故障模式:编辑一个提示模块会静默改变其他模块的行为,尽管没有共享变量或可执行依赖。我们将其形式化为组合行为泄漏(CBL):共享上下文窗口的模块之间的干扰。CBL由架构非隔离性引发:Transformer自注意力机制在为拼接的模块之间不提供正式边界。我们在一个已部署的职位评估智能体(Claude Sonnet 4.6,144次试验)上通过一个可复用的三通道协议来探测CBL,该协议在容量、内容和形式上扰动非焦点模块。只有内容通道产生可检测的配对效应(Cohen's d = 0.63,自举95%置信区间排除零);没有推荐发生翻转——这是一个亚阈值状态,标准QA无法察觉,但在已部署智能体做出的数千个决策中逐渐累积。CBL与已知的智能体故障轴(对抗性注入、认知退化、多智能体故障传播、隐私泄漏)正交。我们贡献了一个可操作的定义、一个可复用的协议、一组可证伪的预测集,以及一个系统级特征描述,将跨模块干扰测量确立为提示组合型智能体评估的必要条件。
查看缓存全文
缓存时间: 2026/06/26 05:12
# 提示组合智能体系统中的跨模块干扰
来源: https://arxiv.org/html/2606.26356
###### 摘要
提示组合智能体系统的实践者报告了一个反复出现的失效模式:编辑一个提示模块会悄然改变其他模块的行为,尽管没有共享变量或可执行依赖。我们将此形式化为*组合行为泄漏*(CBL):共享上下文窗口的模块之间的干扰。CBL 由架构非隔离性促成:Transformer 自注意力在拼接的模块之间没有提供正式边界。我们通过一个可复用的三通道协议,在一个部署的工作评估智能体(Claude Sonnet 4.6,144次试验)上探测 CBL,该协议沿*容量*、*内容*和*形式*三个维度扰动非焦点模块。只有*内容*通道产生可检测的配对效应(Cohen’s d=0.63,bootstrap 95% CI 不包含零);没有推荐发生翻转——这是一个标准 QA 无法察觉但会在部署智能体数千次决策中累积的亚阈值状态。CBL 与已知的智能体失效轴(对抗性注入、认知退化、多智能体故障传播、隐私泄漏)正交。我们贡献了一个操作性定义、一个可复用协议、一个可证伪的预测集以及一个系统类特征描述,将跨模块干扰测量确立为提示组合智能体评估的要求。
智能体系统,失效模式,跨模块干扰,智能体评估,可靠性
## 1 引言
提示组合智能体系统——其中智能体的行为在运行时由自然语言模块组装而成,而非编写为可执行代码,大型语言模型(LLM)将组合后的上下文解释为智能体的策略——是一种快速增长部署模式。这些系统的实践者已经报告了一个反复出现的失效模式:编辑一个提示模块会悄然改变无关模块的行为,且没有共享变量、工具调用或可执行依赖来解释它(Subrahmanyam, 2025 (https://arxiv.org/html/2606.26356#bib.bib17))。因此,风险点在于组合机制本身,而非任何单个模块。OpenClaw (2026 (https://arxiv.org/html/2606.26356#bib.bib15)) 在生产规模上典型化了这种部署模式:37.9万 GitHub 星标和超过1万个社区编写的技能模块,用户将个性定义(SOUL.md)、能力模块(SKILL.md)和编排规则(AGENTS.md)组合成没有任何单个作者完全审计的智能体配置。
同样的模式在多种机制选择中重复出现——Markdown 约定(Steinberger, 2026 (https://arxiv.org/html/2606.26356#bib.bib15); Fernández de Valderrama, 2026 (https://arxiv.org/html/2606.26356#bib.bib16))、模板引擎(Wang et al., 2024 (https://arxiv.org/html/2606.26356#bib.bib18))和 Python 类继承(Gauthier, 2023 (https://arxiv.org/html/2606.26356#bib.bib19))——其中非平凡的行为逻辑体现在 LLM 解释的文本中,而代码仅限于确定性 I/O(§2 (https://arxiv.org/html/2606.26356#S2),表1 (https://arxiv.org/html/2606.26356#S2.T1))。
组合提示模块将产生它们个体行为组合的架构假设,在 Transformer 自注意力中并不成立,因为自注意力在组合上下文中计算全局成对交互,没有模块级隔离:一个 `### 人物角色` 标题是一种写作约定,而非命名空间边界。前摄干扰(Wang and Sun, 2025 (https://arxiv.org/html/2606.26356#bib.bib1))和覆盖有界组合泛化(Chang et al., 2026 (https://arxiv.org/html/2606.26356#bib.bib11))共同预测,每一种新颖的模块组合都是一种分布偏移,其行为后果无法从逐个模块的评估中推导出来。
然而,没有现有的智能体基准测试衡量修改一个提示模块是否会悄然改变一个语义无关模块的行为——这使得模块集偏移下的组合行为成为部署智能体的一阶安全性和可靠性问题。
我们做出四项贡献:
- • 我们给出了*组合行为泄漏*(CBL)的操作性定义——共享注意力上下文中共驻提示模块之间的行为干扰——并将其与组合隐私泄漏(Patil et al., 2025 (https://arxiv.org/html/2606.26356#bib.bib2))、纵向认知退化和对抗性提示注入区分开来。
- • 我们在一个部署的工作评估智能体(Claude Sonnet 4.6;12个职位描述,144次试验)上实例化了一个可复用的三通道协议,提供了跨模块干扰的存在性证明(语义内容通道上 d=0.63;条件 C2,表2 (https://arxiv.org/html/2606.26356#S3.T2))——运行在其他提示组合系统已经产生的工件上。
- • 我们推导了一个可证伪的预测集,构建了多系统复制计划,不需要当前智能体部署之外的新测量基础设施。
- • 我们将提示组合智能体系统在一个跨越四个开源项目的*组合机制谱系*上进行定位,将其确立为智能体系统中的一个独特系统类。
## 2 提示组合智能体系统
### 2.1 模式
*提示组合智能体系统*是指其中非平凡的行为决策逻辑——评分准则、工作流排序、人物定义、工具选择标准——被编码在人类编写的文本文件中,LLM 通过注意力*解释*这些文件,而不是通过运行时执行。
### 2.2 四个系统
表1 (https://arxiv.org/html/2606.26356#S2.T1) 调查了四个开源提示组合智能体系统,涵盖了一个组合机制谱系,从 Markdown 约定(Steinberger, 2026 (https://arxiv.org/html/2606.26356#bib.bib15); Fernández de Valderrama, 2026 (https://arxiv.org/html/2606.26356#bib.bib16))经过 Jinja2 模板(Wang et al., 2024 (https://arxiv.org/html/2606.26356#bib.bib18))到 Python 类继承(Gauthier, 2023 (https://arxiv.org/html/2606.26356#bib.bib19))。在每种情况下,行为逻辑驻留在 LLM 通过注意力解释的文本中;代码仅处理确定性 I/O。随着系统成熟,组合向外迁移(约定→→模板→→类继承→→提示管理服务)——这默认承认文本级组合是脆弱的。然而,部署最广泛的系统(OpenClaw,跨数千个仓库的 AGENTS.md/CLAUDE.md)仍在文本级别进行组合。附录A (https://arxiv.org/html/2606.26356#A1) 提供了每个系统的描述和完整的成熟模式。缺乏对这种脆弱性何时以及如何显现的形式化描述,促使我们在 §3 (https://arxiv.org/html/2606.26356#S3) 中引入定义。
表 1:四个提示组合智能体系统,涵盖一个组合机制谱系。没有任何系统断言提示的 CI 中的行为输出。
## 3 失效模式:组合行为泄漏
### 3.1 操作性定义
设 M = {m₁, ..., mₙ} 是一个已部署的提示模块集合,拼接为 LLM 的输入上下文,并设 M^(j←e) 表示对非焦点模块 mⱼ 应用编辑 e 后的同一模块集合。设 sᵢ(x; M) 表示焦点模块 mᵢ 在输入 x 上的可观察分数或决策。
如果一项无意影响焦点行为的编辑 e 引起可检测的配对偏移,则称系统表现出*组合行为泄漏*(CBL):
Δᵢ(e) = Eₓ[sᵢ(x; M^(j←e)) - sᵢ(x; M)],
其中配对效应的 bootstrap 置信区间不包含零。
更严格的单例比较 B(mᵢ|M) ≈ B(mᵢ|{mᵢ}) 是一个组合一致性检验,可视为此回归观点的特例。在本文中,我们关注已部署系统设置:对非焦点提示模块的局部编辑是否在完整部署提示下悄然改变焦点模块的行为。
CBL 与三种邻近的失效模式不同。*组合隐私泄漏*(Patil et al., 2025 (https://arxiv.org/html/2606.26356#bib.bib2)):多智能体输出聚合揭示敏感信息(隐私 vs. 行为;多智能体 vs. 单智能体拓扑)。*认知退化*(Atta et al., 2025 (https://arxiv.org/html/2606.26356#bib.bib12)):跨多步执行的纵向状态漂移(运行时累积 vs. 初始化干扰)。*提示注入*:对抗性外部输入颠覆行为(恶意 vs. 意外)。实践者非正式地将 CBL 称为“指令泄漏”(Subrahmanyam, 2025 (https://arxiv.org/html/2606.26356#bib.bib17));我们将其形式化。
### 3.2 预测 CBL 的机制
Transformer LLM 的四个属性使 CBL 成为可能,并产生可检验的预测。每个属性贡献一种独特的干扰机制;它们共同使组合*语法*本身成为一个行为变量。
#### 注意力是全局的。
Transformer 自注意力计算整个输入上的成对 token 交互。没有架构机制限制注意力仅在一个提示模块内的 token 上:一个 `### 人物角色` 标题是一个统计提示,而非作用域边界,其有效性完全取决于训练分布中类似格式的先验知识。因此,基于分隔符的隔离是一种行为期望,而非保证。这种非隔离性本身并不证明任何特定系统中的泄漏,但它消除了假设分隔符分隔的模块行为独立的形式基础。
#### 前摄干扰。
Wang 和 Sun (2025 (https://arxiv.org/html/2606.26356#bib.bib1)) 证明,随着累积干扰上下文增加,LLM 检索准确率呈对数线性下降,即使目标紧邻查询之前放置。提示工程缓解措施(“忽略早期输入”、显式作用域指令)效果有限。较早的提示模块*主动退化*后续模块的处理——这是一个单模块测试无法检测的工作记忆瓶颈,因为干扰仅在组合下显现。
#### 覆盖有界组合。
Chang 等人 (2026 (https://arxiv.org/html/2606.26356#bib.bib11)) 形式化指出,组合任务中的模式匹配成功与训练分布覆盖相关(参见 Dziri 等人 (2023 (https://arxiv.org/html/2606.26356#bib.bib8)))。新颖的模块组合不太可能在预训练分布中具有覆盖,从而迫使回退到可能混合无关模块的先验。对于安全关键部署,这意味着在隔离机制得到验证之前,未经测试的模块组合必须被视为行为上不可预测。
#### 格式敏感性。
Sclar 等人 (2024 (https://arxiv.org/html/2606.26356#bib.bib6)) 表明,在单个模型内,意义保持的格式变化会产生高达 76 个百分点的准确率波动。在提示组合智能体系统中,模块组合的*语法*本身就是一个行为变量:标题层级、列表格式、空白和章节排序是独立于语义内容的干扰通道。§3 (https://arxiv.org/html/2606.26356#S3) 中的条件 C3 直接探测此通道。
### 3.3 在已部署智能体上的存在性证明
我们在 career-ops 中测试 CBL,这是一个提示组合的工作评估智能体系统。焦点模块按 1-5 准则对职位描述进行评分,涵盖多个加权维度。我们测量 *cv_match*,这是最直接捕获模块核心评估功能的维度:候选人的背景与职位要求的匹配程度。
#### 条件。
针对未修改的基线(C0:部署的系统提示,按原样提供),我们定义了三个条件,每个条件沿不同通道扰动非焦点模块:
C1(模块添加——*容量*):基线 + 一个无关的 200 行食谱评估模块。
C2(语义修改——*内容*):基线,在共享规则文件中附加一个语义无关的原型(附录B (https://arxiv.org/html/2606.26356#A2))。
C3(格式扰动——*形式*):基线,对非焦点模块进行意义保持的结构性更改(标题层级、表情符号标记、章节重新排序)。
C2 是主要测试:编辑局限于非焦点行为规范,而测量结果则是焦点 cv_match 分数。在系统声明的模块语义下,添加的原型不应系统性地改变此分数;因此,配对偏移表明跨模块干扰。
#### 主要结果。
我们基于构念效度理由预先指定 CV-match 为主要结果:它是准则维度中直接受 C2 中修改的原型检测表影响的下游维度,因此如果存在跨模块干扰,其在此维度上显现的理论先验最高。
#### 协议。
每个条件在 12 个职位描述 × 3 次独立运行上进行评估,使用 Claude Sonnet 4.6(总共 144 次试验)。基于 bootstrap 95% CI(10,000 次重采样)的效应量(Cohen’s d)作为主要分析;Bonferroni 校正的 Wilcoxon 符号秩检验提供二次确认。
#### 结果。
表2 (https://arxiv.org/html/2606.26356#S3.T2) 报告了每个条件的 cv_match 分数和配对效应量,以及 bootstrap 95% CI。
表 2:相对于 C0(基线;均值 = 2.72,SD = 1.23)的每个条件 cv_match 分数。C2(语义干扰,主要测试)显示 bootstrap 95% CI 不包含零;C1 和 C3(对照)则不包含。效应量(Cohen’s d)基于 JD 级配对均值(N=12)计算;bootstrap 95% CI 针对 Δ 来自 10,000 次重采样。C2 是最强信号:向共享规则文件中添加一个无关的原型产生 d=0.63(Δ=+0.17,bootstrap 95% CI [+0.03, +0.31],不包含零),其中 12 个 JD 中有 8 个向上偏移。cv_match 的条件内 ICC 为 0.925,因此在 N=12 的配对对比中,对于框架在语义干预下预测的中到大型效应量,仍保持功效。此偏移满足我们针对 CBL 的操作性准则:对非焦点行为规范的局部编辑会引发焦点 cv_match 分数的可检测偏移。
对照条件使主张更加清晰。C1(d=-0.11)和 C3(d=-0.29)的 CI 包含零,排除了通用的“任何添加上下文都会降低性能”的解释以及格式通道的解释,并将检测到的干扰定位于语义内容——这强化而非削弱了 CBL 的主张。在任何条件下都没有推荐发生翻转——这是一个框架在小语义干预下预测的亚阈值状态,在 §5 (https://arxiv.org/html/2606.26356#S5) 中展开。
## 4 相关工作
#### 智能体失效模式评估。
AgentDojo (2024 (https://arxiv.org/html/2606.26356#bib.bib9)) 评估对抗性注入;QSAF (2025 (https://arxiv.org/html/2606.26356#bib.bib12)) 提出针对认知退化的运行时缓解措施;MAS-FIRE (2026 (https://arxiv.org/html/2606.26356#bib.bib13)) 评估多智能体故障传播;Patil 等人 (2025 (https://arxiv.org/html/2606.26356#bib.bib2)) 评估组合*隐私*泄漏。没有一项测量单个智能体中共驻提示模块之间的同步行为干扰。相似文章
AgentCollabBench:诊断优秀智能体为何成为糟糕的协作者
本文介绍了 AgentCollabBench,这是一个针对多智能体系统的诊断性基准,用于评估四大主流大语言模型(LLM)中的指令衰减和上下文泄漏等行为风险。文章认为,通信拓扑结构是多智能体可靠性的关键因素,其重要性往往超越了模型的原始能力。
诊断不等于补救:语言协同适应解释LLM流水线中的修补风险
本文识别了多模块LLM代理中的'诊断悖论':对于失败因果性责任最大的模块(路由模块)并非最佳干预点,修补该模块反而可能损害性能。作者提出'语言契约'假说,并在三个代理系列中展示了实证证据。
相关但不完整:指称悬空作为硬提示压缩中的范式级失败模式
本文识别了硬提示压缩中的一种结构性失败,称为“指称悬空”,即独立评分会拆散相互依赖的证据对,移除了解释保留答案所需的上下文。实验表明,这种现象影响多种压缩器和数据集,而自动恢复缺失的指称可提高问答准确率。
多步骤智能体不断自我污染,我累了
作者讨论了多步骤AI智能体中一个持续存在的挑战:前一步骤的状态污染会导致幻觉输出。尽管有像EnterPro Agent Builder这样的工具,但仍需更清晰的上下文边界。
分解提示如何引导行为
本文介绍了一个嵌套的几何分解框架,用于分析提示如何重新组织大型语言模型和视觉-语言模型的内部表征。作者表明,仿射变换,特别是跨维度的线性混合,是解释提示引起的行为变化的关键。