从智能体失败到文本策略:有效与失效之处
摘要
本文探讨了基于文本的优化(TextGrad)为何在语言智能体上失败,表明虽然冻结的智能体能够遵循良好的策略,但它们无法可靠地从自身的轨迹中学习和选择策略。
arXiv:2607.20668v1 公告类型: new
摘要: TextGrad 通过根据反馈修正文本来改进语言模型系统。其核心论点是,自然语言反馈可以充当梯度,在无需改变模型权重的情况下优化文本组件。将其应用于智能体则更为困难,因为反馈仅在执行一系列动作后才到达,这使得难以识别哪个决策导致了失败。我们通过分离遵循有用策略的能力与从经验中学习该策略的能力来研究这一问题。我们的主要发现是这两种能力之间存在明显差距。人工编写的策略在两个冻结的 7B 智能体上,于 TextWorldExpress 中提升了 5.0 个成功点,表明有用的策略文本确实存在。然而,从智能体轨迹生成的策略即使使用了更丰富的轨迹、反事实证据或迭代的 GEPA 搜索,也未能可靠地优于固定提示。因此,智能体级 TextGrad 的主要挑战并非执行文本策略更新,而是从经验中可靠地生成和选择策略。
查看缓存全文
缓存时间: 2026/07/24 05:17
# 从智能体失败到文本策略:什么有效,什么失效
来源:https://arxiv.org/html/2607.20668
Jaideep Ray 独立研究者 jaray@acm\.org & Ankit Goyal 独立研究者 ankit@goyalankit\.com
###### 摘要
TextGrad 通过从反馈中修改文本来改进语言模型系统。其核心论点是,自然语言反馈可以充当优化文本组件的梯度,而无需改变模型权重。将此方法应用于智能体更加困难,因为反馈仅在动作序列完成后才到达,这使得难以确定哪个决策导致了失败。我们通过分离遵循有用策略的能力与从经验中学习该策略的能力来研究这一问题。我们的主要发现是这两种能力之间存在明显差距。人类编写的策略在 TextWorldExpress 上使两个冻结的 7B 智能体的成功率提升了 5.0 个百分点,这表明有用的策略文本确实存在。然而,从智能体轨迹生成的策略无法可靠地超越固定提示,即使使用了更丰富的轨迹、反事实证据或迭代的 GEPA 搜索。因此,智能体层面 TextGrad 的主要挑战不在于执行文本策略更新,而在于从经验中可靠地生成并选择这些更新。
# 从智能体失败到文本策略:什么有效,什么失效
Jaideep Ray 独立研究者 jaray@acm\.org Ankit Goyal 独立研究者 ankit@goyalankit\.com
## 1 引言
许多已部署的语言智能体无法进行微调。它们的权重可能是冻结的,只能通过 API 访问,或者更新成本过高。然而,它们的指令仍然是可编辑的。这使得文本优化成为一种在不改变模型的情况下改进智能体的有吸引力方法。
TextGrad 遵循这一思路。它将文本视为可优化组件,并根据自然语言反馈修改该文本 (Yuksekgonul 等人, 2025 (https://arxiv.org/html/2607.20668#bib.bib1))。这个想法对于输入-输出系统来说很直观,因为可以直接判断输出。但对于智能体来说则更困难。智能体执行一系列动作,而早期的错误会改变后续的所有状态。因此,最终的失败并不能揭示哪个动作应该改变,或者哪个教训可以迁移到另一个任务。
我们通过冻结的语言智能体和简短的文本策略来研究这个问题。在训练任务之后,学习器读取智能体的轨迹并提出一个可复用的规则。该规则随后被冻结并在新任务上进行测试。我们将这个原型称为 RulePI。我们的目标不是提出另一个提示优化器,而是确定这类优化在何处成功、何处失效。
我们将这一过程分解为四个问题:
- **执行**:冻结的智能体能否遵循一个有用的规则?
- **证据**:轨迹是否显示了哪个决策至关重要?
- **更新**:学习器能否将该证据转化为可复用的规则?
- **选择**:验证过程能否保留有用的规则并拒绝有害的规则?
如果任何一个问题的答案是“否”,端到端的学习器就会失败。
我们的主要发现是执行与学习之间存在差距。人类编写的策略在 TextWorldExpress 上使两个实际的 7B 智能体提升了 5.0 个成功率点。因此,智能体能够使用好的策略文本。然而,从其轨迹中学习到的规则无法可靠地击败固定提示。即使用更丰富的逐步轨迹、比较同一状态下的动作,或使用官方的 GEPA 搜索,情况仍然如此。证据指向一个特定的瓶颈:被测试的系统无法可靠地将经验转化为好的规则,并决定是否保留它。
## 2 相关工作
有几种方法通过存储语言而不是改变模型权重来改进智能体。Reflexion 为同一任务的另一次尝试写入反馈 (Shinn 等人, 2023 (https://arxiv.org/html/2607.20668#bib.bib2))。ExpeL 从训练经验中提取教训并在之后检索 (Zhao 等人, 2023 (https://arxiv.org/html/2607.20668#bib.bib4))。RulePI 提出了一个更窄的问题:能否从过去的失败中提取一个教训,并将其转化为一个小的策略,帮助完成新任务,而无需在测试时再进行一次尝试?
TextGrad、ProTeGi 和 PACE 根据文本批评修改提示 (Yuksekgonul 等人, 2025 (https://arxiv.org/html/2607.20668#bib.bib1); Pryzant 等人, 2023 (https://arxiv.org/html/2607.20668#bib.bib5); Dong 等人, 2024 (https://arxiv.org/html/2607.20668#bib.bib9))。GEPA 通过重复变异和 Pareto 选择扩展了这一想法,而 RAPOA 和 Feedback Descent 则使用更丰富的分析或成对反馈 (Agrawal 等人, 2026 (https://arxiv.org/html/2607.20668#bib.bib13); Fernandes 等人, 2026 (https://arxiv.org/html/2607.20668#bib.bib14); Lee 等人, 2025 (https://arxiv.org/html/2607.20668#bib.bib15))。Kintsugi 也编辑智能体的控制逻辑 (Cao 等人, 2026 (https://arxiv.org/html/2607.20668#bib.bib11))。我们直接测试了官方的 GEPA,因为它是一个强大的冻结权重优化器。
其他方法会更新模型权重。StarPO、多模块 GRPO、JERP 和经验 RL 通过训练从轨迹中学习 (Wang 等人, 2025 (https://arxiv.org/html/2607.20668#bib.bib18); Ziem 等人, 2026 (https://arxiv.org/html/2607.20668#bib.bib17); Ye and Yu, 2026 (https://arxiv.org/html/2607.20668#bib.bib16); Shi 等人, 2026 (https://arxiv.org/html/2607.20668#bib.bib12))。HiPER 和 HCAPO 在更新权重之前将功劳分配给中间规划或执行步骤 (Peng 等人, 2026 (https://arxiv.org/html/2607.20668#bib.bib19); Tan 等人, 2026 (https://arxiv.org/html/2607.20668#bib.bib20))。LangMARL 为多个智能体生成基于语言的功劳分配 (Yao 等人, 2026 (https://arxiv.org/html/2607.20668#bib.bib21))。这些方法提供了更强大的定位重要决策的方式,但它们回答的是不同的问题,因为它们改变了权重或研究了多智能体学习。
## 3 智能体层面的 TextGrad
设 \(x\) 为当前的文本策略,\(\theta\) 为冻结的模型权重。一次更新包含三个步骤:
\[
\begin{aligned}
\tau &\sim \pi_{\theta}(\cdot \mid x), \quad (1) \\
g_{\mathrm{text}} &= D(\tau, R(\tau)), \quad (2) \\
x^{\prime} &= U(x, g_{\mathrm{text}}), \quad (3)
\end{aligned}
\]
智能体首先在策略 \(x\) 下生成轨迹 \(\tau\)。诊断函数 \(D\) 将轨迹及其奖励转化为文本反馈 \(g_{\mathrm{text}}\)。更新函数 \(U\) 使用该反馈来提出新的策略 \(x^{\prime}\)。我们在测试前冻结 \(x^{\prime}\),并在保留任务中复用它。与重试控制器不同,该策略在行动前看不到当前测试任务的任何失败。
我们使用四个测试来定位失败。首先,**能力测试**提供带有正确基准家族标签的人类编写规则。这是一个特权信息。它询问的是执行器能否使用好的规则,而不是学习器能否发现规则。其次,**证据测试**比较简短的失败总结与上下文受限的轨迹(这些轨迹对齐了每次观察、动作和奖励)。第三,**反事实测试**比较从同一失败状态出发的两个动作。这消除了许多会混淆两次完整重试的差异。最后,**搜索测试**运行官方的 GEPA,它在多轮中提出并选择策略。图 1 (https://arxiv.org/html/2607.20668#S3.F1) 展示了这些部分如何融入一个生命周期,同时保持训练、开发和保留部署的分离。
单规则学习器可以为每个模型和任务家族生成一条最多 80 个词的有类型规则。八条人类编写的 TextWorldExpress 规则每条包含 15-38 个词(平均 26.4 个词;总计 211 个词)。因此,每个单独的目标策略都在学习器的限制之内,尽管能力条件接收到的是完整的有标签库。这使得每次更新都易于检查,但也限制了学习器所能表达的内容。附录给出了确切的证据限制、提示和选择规则。
参见图注 图 1:智能体层面的 TextGrad 生命周期。执行器权重保持冻结,而训练证据提出文本策略更新。开发任务选择并冻结策略,该策略在未见过的保留任务上评估一次,且没有测试时更新。
## 4 实验设置
#### 智能体和环境。
我们使用确定性解码测试了 Qwen2.5-7B-Instruct 和 Mistral-7B-Instruct-v0.3。环境是 TextWorld、TextWorldExpress 和 TextArena (Côté 等人, 2018 (https://arxiv.org/html/2607.20668#bib.bib6); Jansen and Côté, 2022 (https://arxiv.org/html/2607.20668#bib.bib8); Guertler 等人, 2025 (https://arxiv.org/html/2607.20668#bib.bib7))。我们的第一项研究包含跨两个模型、三个基准和七种条件的 6,160 条测试记录。最清晰的真实智能体能力比较来自 TextWorldExpress,因此正文主要围绕该基准。完整的跨基准结果见附录。
#### 策略和基线。
固定基线使用原始指令。人类策略条件为每个 TextWorldExpress 家族添加了编写好的规则。由于规则及其家族路由都是由人提供的,因此该条件是一个能力测试,而非自主学习方法。诊断重试控制给失败的任务一次额外的机会,使用匹配的人类规则。学习条件则通过总结、步骤轨迹、匹配的反事实分支或 GEPA 搜索生成规则。所有策略都使用独立的训练、开发和测试种子,并在测试前冻结。
#### 评估。
我们在相同的环境、种子和目标侧配对方法。我们报告来自 10,000 次重抽样的 95% 聚类自举区间。反事实研究评估每个策略的 320 个配对回合,并为两个学习器提供额外的 102 次 rollout。GEPA 研究在名义上为每个模型进行 320 次搜索调用后,评估每个方法的 160 个配对回合。这些区间是探索性的,因为模型-家族簇的数量很小。我们的主要能力估计汇集了两个模型和所有八个 TextWorldExpress 家族。每个模型的行是一致性检查。每个家族的估计在附录中单独报告,带有未调整的层次间隔,不用于确认性声明。
表 1:TextWorldExpress 成功率(%)。两个执行器行是每个模型的估计;汇总行是跨两个模型和八个家族的主要能力估计。这些不是每个家族的效果。规则和家族路由是特权信息。
## 5 结果
### 5.1 冻结的智能体可以使用好的策略文本
表 1 (https://arxiv.org/html/2607.20668#S4.T1) 回答了第一个问题。人类编写的规则将汇总的 TextWorldExpress 成功率从 15.63% 提高到 20.63%,提升了 5.0 个百分点(CI: +1.88 到 +9.38)。它们平均还减少了 2.64 轮的交互(CI: −5.15 到 −0.41)。两个真实的 7B 模型都有改进。汇总行是我们声明中使用的估计。模型行表明方向并非由单个执行器驱动;它们并未确立跨任务家族的一致增益。
这个结果是有意限制的。人类编写了规则并提供了正确的任务家族路由。实验并未表明系统学习了这些规则。它展示了更基本但必要的事情:有用的文本策略是存在的,并且冻结的智能体可以遵循它们。
### 5.2 基于轨迹的学习无法恢复增益
接下来我们问,系统能否从经验中学习到类似有用的规则。表 2 (https://arxiv.org/html/2607.20668#S5.T2) 总结了三次逐渐增强的尝试。
表 2:汇总的 TextWorldExpress 结果,以百分点和配对 95% 区间表示。每一行在其自己的配对研究中汇集了两个模型和八个家族。各行的含义既不是每个家族的效果,也不是一个排行榜。
首先,逐步轨迹比紧凑的总结帮助更大。与总结相比,它们将成功率提高了 3.75 个百分点。然而,轨迹策略仍然比固定提示低 1.88 个百分点。学习器从更丰富的证据中受益,但并未将这种证据转化为更好的策略。
其次,相同前缀的分支比完整重试提供了更清晰的比较。它们比较来自同一状态的两个动作,同时使用与重试控制相同的 102 次额外 rollout。由此产生的策略比重试学习高出 0.31 个百分点,但比固定提示低 1.25 个百分点。这是一个方向性的弱证据,表明更好的功劳分配,但并非端到端的改进。
第三,在测试预算下,多轮搜索并未可靠地缩小差距。官方 GEPA 在 642 次构建 rollout 和 62 次反思调用后,达到了 20.00% 的成功率,而固定提示为 18.75%。增益为 1.25 个百分点,但其区间跨越零。模型层面的效应也不一致:Qwen 下降了 1.25 个百分点,而 Mistral 上升了 3.75 个百分点。
在所有三个测试中,更好的证据或更广泛的搜索改变了策略,但并未产生可靠的保留增益。对 32 条可直接比较的总结和轨迹规则进行的人工审查有助于解释原因:只有 7 条是扎实的、可执行的策略;9 条看似合理但过于泛泛;16 条是捷径、语义错误或格式错误。完整的分类和示例见附录。
### 5.3 两次转换限制了端到端学习
反事实研究缩小了诊断范围。一个匹配的分支可以表明在特定状态下某个动作更优,但一个可部署的策略还必须说明何时应再次应用这个偏好。这要求学习器从局部比较中恢复出触发器、动作、范围和例外。提出者经常丢失这种结构:它复制了实例细节,将局部对比扩大为无根据的建议,或产生过于模糊而无法改变行为的规则。因此,更清晰的功劳分配并不会自动产生可复用的策略更新。
选择是一个独立的转换。一个候选者可能会改进激发它的情境,同时却降低其他任务的表现,而汇总的开发分数关于这种权衡提供的证据有限。一个可靠的决策门必须评估相关任务家族中的支持度、一致性和回归,而不仅仅是选择观察均值最好的候选者。选择最佳的可用候选者与证明它改进了当前策略不是一回事。
因此,管道有两个不同的接口:轨迹证据必须转化为一个范围恰当的策略,并且该策略必须通过校准的验证来赢得部署。能力测试表明,一旦这些决策被提供,执行器可以执行简洁的策略。尚未解决的挑战是从经验中可靠地做出这两个决策。
## 6 讨论
实验将策略能力与策略归纳分开。能力测试表明,当给定简短的、特定家族的策略时,冻结的智能体可以改进。学习策略的研究并未建立可比的保留改进。因为人类规则每条只有 15-38 个词,80 个词的限制本身不足以解释这个差距。相反,证据指向两个相互关联的困难:从轨迹中推导出正确的可复用更新,以及从有限的开发数据中决定是否保留它。
更丰富的证据改进了中间比较。轨迹对齐的轨迹优于紧凑的总结,相同前缀的分支比完整重试更直接地隔离了动作差异。然而,在规则生成和选择之后,这两种干预措施都未能持续提高保留完成率。GEPA 扩展了更新空间并使用了迭代搜索,但其汇集的保留区间包含零。这些结果区分了证据质量与端到端策略改进:更好的证据可以澄清更新目标,但其价值取决于生成和选择程序能否利用它。相似文章
通过失败轨迹进行基于策略的自我进化以实现智能体安全对齐
本文提出了 FATE,这是一种基于策略(on-policy)的框架,它利用失败轨迹通过自我进化和感知帕累托前沿的优化来增强使用工具的 LLM 智能体的安全性和性能。
AI代理的失败方式鲜有人论及。以下是我亲眼所见。
文章强调了AI代理工作流程中实际的系统级失败,例如上下文泄漏和幻觉细节,认为这些通常是基础设施问题而非模型缺陷。
从策略错误中恢复:鲁棒GUI代理的基准测试与轨迹合成
引入GUI-RobustEval(一个用于GUI代理错误恢复的基准)和鲁棒性驱动轨迹合成(RoTS)以生成训练数据,在OSWorld上达到当前最佳性能。
每个人都关注他们的智能体是否完成任务,但几乎没人问它是否在随着时间的推移变得更好
文章指出了AI智能体开发中一个常见的忽视点:虽然大多数团队会监控任务完成情况,但很少有系统能够捕获失败模式并将其反馈到未来的运行中,从而实现学习和持续改进。
为什么你的智能体“成功”了,三天后却发现其实没有
探讨AI智能体在任务中看似成功,但后来暴露失败的现象,突出了智能体评估与监控中的挑战。