面向多LLM智能体系统上下文自适应的基于图的目标反向传播
摘要
本文提出了GTBP,一种用于多LLM智能体系统中上下文自适应的基于图的反向传播框架,它通过理论收敛保证改进了提示优化,并在基准测试中优于现有方法。
arXiv:2606.14155v1 Announce Type: new
摘要:上下文自适应通过迭代地从任务反馈中修改可调提示,无需修改模型权重,从而自动化基于LLM系统中的提示工程。将这一范式扩展到多LLM智能体系统至关重要:现有方法存在不准确的信用分配问题且缺乏收敛保证。我们提出了\textbf{G}raph-based \textbf{T}arget \textbf{B}ack-\textbf{P}ropagation (GTBP),一种针对建模为有向无环图的智能体工作流的上下文自适应框架。GTBP在工作流图中向后传播局部目标输出,并利用目标-输出差异指导分阶段的提示更新机制。理论上,我们证明了GTBP的分阶段提示更新在迭代过程中变得稳定,并且足够强大的LLM优化器可以降低整体目标。实验上,GTBP在三个基准测试上持续优于强基线,同时保持相当的计算成本。
查看缓存全文
缓存时间: 2026/06/15 09:11
# 基于图的目标反向传播:多LLM代理系统中的上下文自适应
来源:https://arxiv.org/html/2606.14155
Tan Zhu, Tong Yao, Kananart Kuwaranancharoen, Amit Singh, Yushang Lai, Deepa Mohan, Shankar Bhargava
Retail Intelligence, Walmart Global Tech, Sunnyvale, CA, USA
{tan.zhu (https://arxiv.org/html/2606.14155v1/mailto:[email protected]), tong.yao (https://arxiv.org/html/2606.14155v1/mailto:[email protected]), kananart.kuwaranancharoen (https://arxiv.org/html/2606.14155v1/mailto:[email protected]), amit.singh2 (https://arxiv.org/html/2606.14155v1/mailto:[email protected]), yushang.lai (https://arxiv.org/html/2606.14155v1/mailto:[email protected]), deepa.mohan (https://arxiv.org/html/2606.14155v1/mailto:[email protected]), shankara.bhargava (https://arxiv.org/html/2606.14155v1/mailto:[email protected])} @walmart.com
###### 摘要
上下文自适应通过基于任务反馈迭代优化可调提示来自动化基于LLM系统的提示工程,而无需修改模型权重。将这一范式扩展到多LLM代理系统至关重要:现有方法存在信用分配不准确且缺乏收敛保证的问题。我们提出**基于图的目标反向传播(GTBP)**,这是一个针对代理工作流(建模为有向无环图)的上下文自适应框架。GTBP通过工作流图反向传播局部目标输出,并利用目标-输出差异指导阶段式提示更新机制。理论上,我们证明了GTBP的阶段式提示更新在迭代中会趋于稳定,并且足够强大的LLM优化器可以降低整体目标函数。实验上,GTBP在三个基准测试中持续优于强基线方法,同时保持相当的计算成本。
基于图的目标反向传播:多LLM代理系统中的上下文自适应
Tan Zhu, Tong Yao, Kananart Kuwaranancharoen, Amit Singh, Yushang Lai, Deepa Mohan, Shankar Bhargava
Retail Intelligence, Walmart Global Tech, Sunnyvale, CA, USA
{tan.zhu (https://arxiv.org/html/2606.14155v1/mailto:[email protected]), tong.yao (https://arxiv.org/html/2606.14155v1/mailto:[email protected]), kananart.kuwaranancharoen (https://arxiv.org/html/2606.14155v1/mailto:[email protected]), amit.singh2 (https://arxiv.org/html/2606.14155v1/mailto:[email protected]), yushang.lai (https://arxiv.org/html/2606.14155v1/mailto:[email protected]), deepa.mohan (https://arxiv.org/html/2606.14155v1/mailto:[email protected]), shankara.bhargava (https://arxiv.org/html/2606.14155v1/mailto:[email protected])} @walmart.com
## 1 引言
通过输入上下文(如任务指令、工具使用指南和记忆检索指令,这些指令指导如何选择和整合外部信息 (Schulhoff et al., 2024 (https://arxiv.org/html/2606.14155#bib.bib2))),大语言模型(LLM)能够在**代理系统**中协调多个基于LLM的模块,进行多步问题求解 (Li, 2025 (https://arxiv.org/html/2606.14155#bib.bib32))。本文研究这种多模块LLM系统的**上下文自适应**,即在模型权重保持不变的情况下,通过任务反馈自动修改输入上下文。
令 $\Phi$ 表示一个具有固定模型权重和可调提示集 $\Pi_{\Phi}$ 的代理系统。给定任务分布 $\mathcal{T}$ 和任务级损失函数 $\ell$,上下文自适应的目标是找到最小化 $\ell$ 的最优 $\Pi_{\Phi}^{*}$:
$$\Pi_{\Phi}^{*} = \operatorname*{arg\,min}_{\Pi_{\Phi}} \mathbb{E}_{x \sim \mathcal{T}} \left[ \ell\!\left( \Phi(x; \Pi_{\Phi}) \right) \right].$$ (1)
早期的代理系统通常依赖人工设计的上下文、提示和指令来协调多个基于LLM的模块 (Hong et al., 2024 (https://arxiv.org/html/2606.14155#bib.bib4); Qian et al., 2024 (https://arxiv.org/html/2606.14155#bib.bib5))。上下文自适应通过从任务反馈中更新可调提示来自动化这一过程,无需修改模型权重。LLM的最新进展,包括更长的上下文窗口和更低的推理延迟 (Gemini Team, 2024 (https://arxiv.org/html/2606.14155#bib.bib21); OpenAI, 2024 (https://arxiv.org/html/2606.14155#bib.bib20)),使得将LLM不仅视为任务求解器,而且视为迭代检查、批评和修改提示的优化器变得越来越可行。这使得上下文自适应成为昂贵的手动提示工程的一种实用替代方案,尤其适用于多模块代理系统的工作流。
在多模块代理系统中,上下文自适应引入了**信用分配**问题:最终错误必须归因于负责的模块特定上下文 (Meulemans et al., 2021 (https://arxiv.org/html/2606.14155#bib.bib26))。代理工作流涉及基于文本的上下文、离散动作和黑盒LLM模块,这使得广泛应用于人工神经网络(ANN)的基于梯度的信用分配难以直接应用。为了分配信用,GEPA和ACE等方法使用LLM调用,将整个代理工作流作为输入 (Agrawal et al., 2025 (https://arxiv.org/html/2606.14155#bib.bib12); Zhang et al., 2025 (https://arxiv.org/html/2606.14155#bib.bib13))。然而,由于这种分配是隐式执行的,而不是通过显式定义的推理过程,因此可能是非确定性的,并且不清楚哪些提示应该被更新。这导致了被称为**归因模糊性**的挑战 (Huang et al., 2026 (https://arxiv.org/html/2606.14155#bib.bib27))。
为了显式定义多代理系统上的信用分配管道,TextGrad (Yuksekgonul et al., 2024 (https://arxiv.org/html/2606.14155#bib.bib3)) 和 Agentic Neural Networks (Ma et al., 2025 (https://arxiv.org/html/2606.14155#bib.bib25)) 等方法使用图结构建模多代理系统,并在代理节点之间传播LLM生成的文本反馈。然而,这些管道在很大程度上仍然是启发式的,并未直接与式(1) (https://arxiv.org/html/2606.14155#S1.E1) 中的提示优化目标耦合。此外,在分配信用后,使用启发式基于规则的LLM优化器来更新提示。它们在多模块代理系统中的收敛性质在理论上仍未充分探索。
为了解决这些局限性,我们从差异目标传播(Difference Target Propagation, DTP)中汲取灵感,该方法通过传播局部目标而非梯度来分配信用 (Lee et al., 2015 (https://arxiv.org/html/2606.14155#bib.bib23); Meulemans et al., 2020 (https://arxiv.org/html/2606.14155#bib.bib24))。基于这一思想,我们提出**基于图的目标反向传播(Graph-based Target Back-Propagation, GTBP)**,一种用于代理系统的上下文自适应管道。总之,本文做出以下贡献:
- • 我们提出GTBP,一种用于多LLM代理系统上下文自适应的基于图的信用分配框架。与依赖轨迹级反射不同,如图1 (https://arxiv.org/html/2606.14155#S1.F1) 所示,GTBP沿着工作流图推断子模块的局部目标输出,并利用目标-输出差异指导阶段式提示更新。
- • 我们提供了GTBP的理论分析,证明其阶段式提示更新在迭代中趋于稳定,并且通过足够强大的LLM优化器可以降低式(1) (https://arxiv.org/html/2606.14155#S1.E1) 中定义的任务级目标。
- • 我们在真实世界基准数据集上经验性地验证了GTBP,并证明与强基线方法相比,它持续提高了提示优化性能。
 在正向执行后,GTBP从最终目标输出推断中间模块的局部目标。每个模块随后将其当前输出与推断目标进行比较,产生的信用信号用于更新其提示,无需梯度访问。
## 2 相关工作
### 2.1 信用分配
信用分配是学习系统中的一个基本问题,其中全局反馈必须归因于导致结果的内部组件 (Minsky, 1961 (https://arxiv.org/html/2606.14155#bib.bib14))。在ANN中,通常通过基于链式法则的梯度反向传播来解决 (Bottou et al., 2018 (https://arxiv.org/html/2606.14155#bib.bib15))。替代方法探索了超出梯度反向传播的不同信用分配机制。例如,解耦神经接口通过为中间模块学习合成梯度来解耦信用分配 (Jaderberg et al., 2017 (https://arxiv.org/html/2606.14155#bib.bib18))。相比之下,差异目标传播(DTP)提供了一种基于目标的替代方案,为中间组件分配期望输出 (Bengio, 2014 (https://arxiv.org/html/2606.14155#bib.bib22); Lee et al., 2015 (https://arxiv.org/html/2606.14155#bib.bib23); Meulemans et al., 2020 (https://arxiv.org/html/2606.14155#bib.bib24))。
随着LLM上下文长度的快速发展 (Wang et al., 2024 (https://arxiv.org/html/2606.14155#bib.bib16)) 和推理效率的提升 (Zhou et al., 2024 (https://arxiv.org/html/2606.14155#bib.bib17)),MIPROv2 (Opsahl-Ong et al., 2024 (https://arxiv.org/html/2606.14155#bib.bib45))、GEPA (Agrawal et al., 2025 (https://arxiv.org/html/2606.14155#bib.bib12)) 和 ACE (Zhang et al., 2025 (https://arxiv.org/html/2606.14155#bib.bib13)) 等方法使用LLM推理来近似文本执行轨迹上的信用分配。然而,由于信用是通过黑盒LLM反射分配的,该过程难以控制。为了使其更加结构化,最近的工作如TextGrad (Yuksekgonul et al., 2024 (https://arxiv.org/html/2606.14155#bib.bib3)) 和 Agentic Neural Networks (Ma et al., 2025 (https://arxiv.org/html/2606.14155#bib.bib25)) 通过类似神经网络的代理工作流传播文本梯度。TextResNet则通过一种有利于信用分配的残差架构来改进归因,用于信号分解和路由 (Huang et al., 2026 (https://arxiv.org/html/2606.14155#bib.bib27))。
### 2.2 上下文自适应
上下文自适应通过使用任务反馈或LLM生成的反馈自动修改输入上下文(如提示、指令或检索到的证据),扩展了手动提示工程 (Schulhoff et al., 2024 (https://arxiv.org/html/2606.14155#bib.bib2); Sahoo et al., 2024 (https://arxiv.org/html/2606.14155#bib.bib1))。代表性方法在更新文本上下文的方式上有所不同。早期的自动提示优化方法依赖于非文本反馈,如任务级分数。APE (Zhou et al., 2023 (https://arxiv.org/html/2606.14155#bib.bib6)) 和 OPRO (Yang et al., 2024 (https://arxiv.org/html/2606.14155#bib.bib7)) 使用标量评估信号搜索LLM生成的提示候选。超越基于度量的信号,最近的研究如Reflexion (Shinn et al., 2023 (https://arxiv.org/html/2606.14155#bib.bib11)) 和 GEPA (Agrawal et al., 2025 (https://arxiv.org/html/2606.14155#bib.bib12)) 利用文本反馈进行迭代改进。通过文本信用信号,提示可以以更结构化的方式更新,例如ACE中的操作手册 (Zhang et al., 2025 (https://arxiv.org/html/2606.14155#bib.bib13))。
上下文自适应的理论理解仍处于新兴阶段。由于现代LLM主要建立在Transformer架构上,早期工作将上下文自适应与权重更新联系起来,表明提示更新可以产生等同于参数更新的效果 (Li et al., 2024 (https://arxiv.org/html/2606.14155#bib.bib9))。最近的工作进一步表明,上下文条件化行为可能与模型权重的隐式优化有关 (Dherin et al., 2025 (https://arxiv.org/html/2606.14155#bib.bib36)),尽管对这种关系的一般理论表征仍然是开放的。
## 3 问题表述
在本节中,我们通过将代理系统定义为有向图,并指定本文研究的工作流,来具体化式(1) (https://arxiv.org/html/2606.14155#S1.E1) 中的目标。
一个代理工作流被建模为一个有向无环图 $\mathcal{G} = (\mathcal{V}, \mathcal{E})$,其中每个节点 $v \in \mathcal{V}$ 对应一个调用LLM的子模块 $O_v = M_v(I_v; \pi_v)$,该子模块由可调提示 $\pi_v$ 和输入 $I_v$ 参数化。对于任何节点 $v$,输入由其前驱节点的输出聚合而成:
$$I_v = \{ O_u \mid (u, v) \in \mathcal{E} \}.$$
在这个基于图的工作流中,节点输出被传递给下游节点,并聚合形成后续输入。算法1 (https://arxiv.org/html/2606.14155#alg1) 描述了工作流如何执行图并将中间节点的输出组合成最终输出。
**算法1** 基于图的代理工作流的前向执行
1: 图 $\mathcal{G} = (\mathcal{V}, \mathcal{E})$,具有输入节点集 $\mathcal{V}_{\mathrm{in}}$ 和输出节点 $v_{\mathrm{out}}$,外部输入 $x$,提示 $\{ \pi_v \}_{v \in \mathcal{V}}$
2: 最终系统输出 $y$
3: **对于** 每个节点 $v \in \mathcal{V}$ 按拓扑顺序 **执行**
4: **如果** $v \in \mathcal{V}_{\mathrm{in}}$ **则**
5: $I_v \leftarrow x_v$
6: **否则**
7: $I_v \leftarrow \{ O_u \mid (u, v) \in \mathcal{E} \}$
8: **结束如果**
9: $O_v \leftarrow M_v(I_v; \pi_v)$
10: **结束循环**
11: $y \leftarrow O_{v_{\mathrm{out}}}$
在本文中,我们关注一个单隐藏层代理工作流。给定输入消息 $x$,工作流包含 $K$ 个提示可调的LLM子模块,它们产生中间响应:
$$O_k = M_k(x; \pi_k), \qquad k = 1, \dots, K.$$ (2)
给定这些中间响应,工作流包含一个输出节点,它将这些响应与原始输入聚合以产生最终输出:
$$y = M_{\mathrm{out}}(x, O_1, \dots, O_K; \pi_{\mathrm{out}}).$$ (3)
在整篇论文中,所有LLM参数都是固定的,只有提示 $\{ \pi_1, \dots, \pi_K, \pi_{\mathrm{out}} \}$ 被更新。这种结构创建了一个简单的信用分配设置,其中最终错误可能源于任何中间模块或输出模块。
给定这个工作流图,令 $\Pi_{\Phi} = \{ \pi_v \}_{v \in \mathcal{V}}$ 表示整个系统的提示集。对于文本输入 $x$,图执行会产生最终系统输出 $y = \Phi(x; \Pi_{\Phi})$,遵循算法1 (https://arxiv.org/html/2606.14155#alg1)。对于从任务分布 $\mathcal{T}$ 中采样的输入-参考对 $(x, y^*)$,令 $\ell(y, y^*)$ 表示衡量系统输出与参考之间差异的输出级损失。上下文自适应目标因此为:
$$\Pi_{\Phi}^{*} = \operatorname*{arg\,min}_{\Pi_{\Phi}} \mathbb{E}_{(x, y^*) \sim \mathcal{T}} \left[ \ell\!\left( \Phi(x; \Pi_{\Phi}), y^* \right) \right].$$ (4)
在我们的实验中,$\ell$ 使用与每个数据集 $\mathcal{T}$ 相关的评估指标来实例化。
## 4 提出的方法
本节介绍**基于图的目标反向传播(GTBP)**,它使用LLM引导的目标传播,将输出级反馈通过代理工作流向后追溯,并为提示分配局部优化信号。相似文章
面向智能体与多模态大语言模型的上下文感知强化学习
介绍了ContextRL,一种强化学习方法,教会大语言模型识别哪些上下文支持答案,在智能体和多模态基准上取得了性能提升。
GBC:基于梯度的连接以优化多智能体系统
提出基于梯度的连接(GBC)方法,将多智能体LLM系统建模为计算图,并利用梯度信号将错误归因到特定智能体,从而更好地进行系统级优化。
ExpGraph:面向LLM智能体的模型无关经验学习与图结构记忆
ExpGraph是一个模型无关的框架,通过自进化的技能与失败经验图,使LLM智能体能够复用过往经验,在不重新训练执行器的情况下将任务性能提升12%-21%。
有限适应性下的上下文Slate GLM Bandits
提出了在有限适应性下具有广义线性奖励的上下文Slate Bandit算法,实现了与非线性参数无关的遗憾界。批量式和少切换算法计算高效,且在经验上优于基线,包括在语言模型示例选择任务中。
学习跨域多智能体LLM协作的可迁移拓扑先验
本文提出TopoPrior框架,该框架从离线参考协作图中学习可迁移的拓扑先验,以生成跨域多智能体LLM协作的初始拓扑,显著降低了在线搜索开销和令牌消耗。