AgentBrew: 从强教师到弱LLM代理的终身知识酿造
摘要
AgentBrew 提出了一种无需训练的方法,将知识从强教师 LLM 代理蒸馏到弱学生代理,通过失败触发的反思循环和感知学生的合成来创建可执行的笔记,提高了编码、数学和工具使用任务的性能,而无需更新权重。
arXiv:2607.16851v1 公告类型:新
摘要:部署 LLM 代理通常需要一个紧凑的测试时学生,即使训练时有更强的教师可用。我们研究知识酿造:将教师的交互经验蒸馏到学生的持久外部记忆中。关键的是,这不需要权重更新、专家演示、真实标签或测试时访问教师。这种设定面临两个挑战:环境只提供稀疏的二元反馈,且教师编写的笔记必须天生地定制为能够被明显更弱的学生具体执行。为了解决这些障碍,我们提出了 AgentBrew,包含两个耦合组件。首先,一个失败触发的教师——Ralph Loop 通过将学生失败转化为环境验证的笔记来缓解稀疏反馈。其次,感知学生的合成将教师知识校准到弱执行者的操作粒度,产生模型特定的可操作指导。在编码、数学和工具使用任务上的广泛评估和全面消融表明,这种非对称的、无需训练的酿造范式能够产生高度能力且可部署的 LLM 代理。
查看缓存全文
缓存时间: 2026/07/21 06:41
# AgentBrew:从强教师到弱LLM代理的终身知识淬炼
**来源:** https://arxiv.org/html/2607.16851
杨沁江 黄超
香港大学
\{mrjiangyq99, chaohuang75\}@gmail.com
**Github Repo:** https://github.com/HKUDS/UpSkill
###### 摘要
部署LLM代理通常需要一个紧凑的测试时学生模型,即使训练时存在更强的教师模型。我们研究知识淬炼(knowledge brewing):将教师的交互经验蒸馏到一个持久的外部记忆中,供学生使用。关键在于,这不需要权重更新、专家演示、真实标签或测试时访问教师模型。这种设置带来了两个挑战:环境只提供稀疏的二元反馈,而且教师撰写的笔记必须天然地适合由能力弱得多的学生具体执行。为了应对这些难题,我们提出了AgentBrew,包含两个耦合组件。首先,一个失败触发的教师–Ralph Loop通过将学生失败转化为经过环境验证的笔记,来缓解稀疏反馈问题。其次,学生感知的综合(student-aware synthesis)将教师知识校准到弱执行者的操作粒度,产生针对特定模型、可执行的指导。在编码、数学和工具使用任务上的广泛评估和全面消融实验表明,这种非对称、无需训练的知识淬炼范式能够产生能力强且易于部署的LLM代理。
## 1 引言
大型语言模型(LLM)代理现在可以在编码、数学和工具使用环境中解决交互式任务[1, 2, 3, 4]。然而在生产环境中,必须处理请求的代理通常是一个小型或仅限API的模型:微调可能不可用,推理成本必须保持低廉,并且模型权重在部署后视为固定。一个自然的替代方案是教师–学生代理淬炼¹:一个更强的教师代理T(大型LLM)在训练期间蒸馏交互经验,而一个紧凑的学生代理S(小型LLM)在测试时仅依赖检索到的外部知识独立运行。核心问题是如何将淬炼期间的交互转化为持久的笔记,从而在不更新其参数的情况下提升S的有效能力。两个挑战使得这个设置比单纯的自我进化或标准蒸馏都困难得多。
**挑战一:环境反馈稀疏。** 真实的基准测试和部署的API通常只暴露一个终端二元奖励R∈{0,1}——通过或失败——以及代理自身的展开轨迹,但没有真实解决方案、专家轨迹或步骤级标签。当S失败时,唯一的额外信号是失败轨迹τ_S(x);当S成功时,不需要教师干预。
**挑战二:教师–学生能力差距(即,知识是模型特定的)。** 在上述部署场景中,T有意设计得比S强得多,但存储在记忆中的笔记必须由T撰写并由S执行。对强模型来说读起来不错的知识,在实践中往往对弱模型无效:T认为显而易见的推理步骤被省略了,词汇和概念超出了S的舒适区,纠正性规则过于粗糙而无法转化为具体行动。图1明确显示了这种依赖关系:当测试时固定使用Qwen3-14B时,S教师+W学生淬炼的性能优于S教师+S学生淬炼,这表明可迁移的笔记取决于淬炼中涉及的学生模型,而不仅仅是教师质量。因此,弥合这一差距是首要的设计问题。
图见说明
**图 1:** 不同淬炼时教师–学生LLM配对下的MATH和GSM8K准确率(测试学生:Qwen3-14B)。强(S)/弱(W)分别表示DeepSeek-Chat-v3.1和Qwen3-14B。
现有工作仅涉及问题的部分方面。自我进化代理[5, 6]可以从环境反馈中改进而无需权重更新,但它们通常(i)进化同一个既行动又学习的模型,(ii)在测试时继续适应,并且(iii)并非为不对称的教师-学生“淬炼”而构建——在淬炼中,笔记必须针对固定的弱执行者进行验证。代理蒸馏[7, 8]可以将教师行为压缩为轨迹或可复用的工件,但它通常依赖于标记对或成功的教师展开,并且以教师级别的抽象层次传递知识,而不是作为经过弱执行者验证的可执行笔记。
因此,我们围绕三个问题展开研究:
**Q1(学习信号)。** 当环境只暴露二元R且没有专家数据时,弱代理如何从失败中提取有用知识,以及如何在存储之前验证这些知识?
**Q2(能力差距)。** 强教师如何撰写知识,使得能力弱得多的学生能够——而不仅仅是能够解析——执行,考虑到生成和验证都受到能力差距的影响?
**Q3(终身积累)。** 如何让经过验证、经学生校准的知识跨任务在外部记忆中积累,而不更新学生权重S,同时保持测试时推理的轻量级和稳定性?
我们提出一个淬炼–服务框架(图2),将Q1–Q3映射到三个耦合组件:一个失败触发的教师–Ralph Loop、学生感知的笔记综合,以及一个终身记忆M。我们称之为**AgentBrew**:*淬炼 (brewing)* 是Ralph Loop [9],它迭代地从失败中蒸馏经过认证的笔记,而学生感知的综合将每个笔记定制为其执行者,就像酿酒师根据原料调整方法一样。在训练集D_train上的淬炼过程如下。学生S在每个任务上与环境交互;当R=0时,教师T读取(x, τ_S(x))——这是除了二元通过/失败以外唯一的监督信号——并草拟一个结构化的候选笔记。该笔记通过学生感知的提示和面向行动的模板来撰写,使得T瞄准S的阅读水平和操作粒度,而不是其自身的水平。然后Ralph Loop暂存该笔记并在同一任务上重新运行S:恢复(R=1)仅使用环境反馈就认证了该笔记,并拒绝了那些对T来说似乎合理但对弱执行者不可用的指导。一个策展人对通过认证的笔记进行去重,并将其追加到M中,M随着训练数据流增长而不更新S。在测试集D_test上服务时,使用冻结的M*:T不活动,S检索技能范围内的top-k笔记,并在一次展开中完成任务,无需迭代反思或在线写入记忆。
AgentBrew遵循一个简单的原则:**知识不是通用的——它必须适合执行它的代理。** 我们的主要贡献是:
* **稀疏反馈下的淬炼–服务。** 我们开发了一种为固定弱代理构建终身知识的方法,仅使用环境的二元反馈,不需要专家轨迹、测试时标签或任何权重更新。
* **学生校准的知识迁移。** 我们引入了学生感知的笔记综合,它主动地将教师知识以S的操作粒度撰写,并结合Ralph恢复作为一个反应式过滤器,在弱执行者上(而非仅仅基于教师的合理性)认证笔记。
* **全面评估。** 我们在三种典型的代理任务(即编码、数学和工具使用)上,在共享的淬炼–服务协议下对AgentBrew进行了基准测试,并通过消融研究评估了我们方法的有效性。
## 2 AgentBrew框架
### 2.1 问题形式化
**设定。** 我们研究交互式任务x(例如,数学、编码或工具使用)。一个由小型LLM驱动的固定学生代理S与环境Env交互最多H步,生成轨迹τ_S(x)和二元终端奖励R(x, τ)∈{0,1}。值得注意的是,环境不提供真实解决方案、标签或专家轨迹。在训练期间(D_train),引入一个由大型LLM驱动的更强教师代理T:每当S失败时,T分析任务和失败轨迹,合成结构化的笔记到外部记忆库M中。在测试期间(D_test),M被冻结,T完全不存在;相反,S通过从M中检索到的笔记增强,在一次遍历中解决问题。总体而言,学习完全由环境反馈和失败轨迹驱动,没有离线演示、测试时标注或对S参数的更新。
**目标。** 在D_train上淬炼出一个持久的记忆M*,以最大化保留集上的成功率:
M* ∈ arg max_M E_{x~D_test}[ R(x, τ_S(x|M)) ], (1)
其中τ_S(x|M)是学生代理S在将其提示前缀上来自M的top-k笔记后展开的轨迹。所有终身增益都存储在M*中,而不是学生代理的权重中。
### 2.2 框架概览
图见说明
**图 2:** 提出的AgentBrew的总体框架。
AgentBrew通过一个**淬炼–服务**范式(图2)来实现第2.1节中的目标:整个系统包括三个设计选择,每个选择都回应了引言中提出的研究问题: (Q1) 一个失败触发的教师将来自环境的稀疏二元反馈转化为结构化候选笔记,并有一个策展人将环境认证的条目合并到M中(第2.3节); (Q2) 反应式的Ralph验证加上主动的学生感知综合,弥合教师和学生代理之间的能力差距(第2.4节); (Q3) 一个终身记忆M跨任务积累经过验证的笔记,而不更新学生LLM(第2.5节)。这里总结它们如何交互:
* **淬炼阶段** *(在D_train上)*。对于每个任务x,学生代理S在Env中尝试x。如果R=1,则不调用教师,流程进入下一个任务。如果R=0,教师代理T读取(x, τ_S(x)),并通过学生感知的提示,提出一个结构化的候选笔记n。Ralph Loop [9] 将n注入S,并**在同一**任务x上重新展开:成功重新展开 (R=1) 验证n,而持续失败则触发修改或丢弃。通过Ralph Loop的笔记由一个策展人代理进行合并——仅执行去重和质量门控,因为正确性已由环境认证——并追加到M中。这个循环在训练数据流上重复,逐步淬炼出M*。
* **服务阶段** *(在D_test上)*。在测试时,记忆是只读的,教师代理T不活动。给定一个新任务x,S从冻结的记忆M*中检索top-k笔记(通过技能范围路由和重排序),将其前缀到提示中,并在**单次**环境展开中完成x——无需迭代反思循环或额外的验证调用。如果检索没有返回笔记,S则回退到其原始策略。
### 2.3 从二元反馈到经过验证的知识
当环境只暴露终端奖励R∈{0,1}时——没有步骤级标签、没有专家轨迹、没有标注解释——淬炼阶段必须从失败中提取持久知识。我们通过将每次失败视为一个监督事件来解决Q1。这里我们详细描述失败触发的激活流水线、由T写入的笔记表示,以及在持久写入前的策展。
#### 2.3.1 失败触发的教师激活
**输入:** D_train, 学生S, 教师T, 记忆M, 环境Env
1: **对于每个** x ∈ D_train **执行**
2: N ← 检索(M, x) // 为x检索到的笔记(可能为∅)
3: τ_S(x) ← 展开(S, x, N)
4: R ← 评估(Env, x, τ_S(x)) // R∈{0,1}; 来自Env的唯一外部监督
5: **如果** R=1 **则**
6: 继续 // 成功:不调用T
7: **否则**
8: n ← 草拟笔记(T, x, τ_S(x), fail) // 无参考解决方案
9: RalphLoop(x, n, S, T, C, M, Env) // 精炼和策展
10: **结束如果**
11: **结束循环**
**算法 1** 在D_train上的失败触发教师激活。
在淬炼期间,每个任务x∈D_train首先由学生代理S展开,产生τ_S(x)和奖励R∈{0,1}。二元R是来自Env的唯一外部监督信号:不提供步骤级标签、专家轨迹或标注解释。如果R=1,流程进入下一个任务而不调用T。如果R=0,我们在三元组(x, τ_S(x), fail)上触发T。与监督微调(SFT)不同,T从不基于参考解决方案;它仅从学生轨迹和任务文本中诊断失败模式,然后提出一个纠正性的笔记。这种设计使得在只有通过/失败反馈可用的环境中也能进行学习。算法1总结了控制流。
#### 2.3.2 结构化笔记生成
给定一次失败,T输出一个候选笔记n作为结构化的JSON,而不是一个完整的示例。每个笔记是一个抽象的、可复用的规则,旨在用于未来结构相似的任务的检索:
* **note_key:** 唯一标识符(在更新现有规则时复用);
* **trigger:**相似文章
AgentBrew:从原始现实世界轨迹进行的离线工具使用智能体学习
AgentBrew 引入了一个离线训练框架,用于工具使用智能体,它从原始交互轨迹中学习,无需任务验证器,使用回顾性任务推断和基于互信息的信用分配,以提升在 GitHub 和 Notion 等现实世界应用中的性能。
Agent Memory Distillation:利用层级教师记忆赋能小型LLM智能体
本文介绍了Agent Memory Distillation(AMD),一种无需训练的框架,通过层级记忆将结构化知识从大型教师智能体迁移到小型学生智能体,在工具使用基准测试上的性能提升达3.4–27.2个百分点。
SkillMaster:迈向大语言模型智能体的自主技能掌握
本文介绍了 SkillMaster,一种训练框架,使大语言模型智能体能够通过轨迹知情审查和反事实效用评估,自主地创建、优化和选择技能。
无知还是无能?为LLM智能体构建知识门控可验证任务
本文提出了一种知识门控任务构建协议,用于明确测试LLM智能体对隐藏知识的依赖性。校准任务验证表明,在无法访问私有约定时,模型性能会显著下降。
并非所有技能都有帮助:衡量与修复智能体知识
本文指出,在LLM智能体中简单积累技能可能导致性能倒退,因为对某些任务有益的技能反而会损害其他任务。作者提出Assay框架,该框架衡量每个技能的因果贡献,并对每个任务进行掩码处理,在不更新权重的情况下,在AppWorld和τ-bench上取得了最先进的结果。