CacheRL:基于缓存回滚和混合奖励的多轮工具调用智能体
摘要
CacheRL训练用于多步工具调用任务的小型智能体基础模型,通过缓存回滚和混合奖励塑造,以100倍更少的计算量实现了92%的过程准确率(接近GPT-5的94%),并在知识迁移、缓存感知奖励以及迭代SFT/GRPO训练方面进行了创新。
查看缓存全文
缓存时间: 2026/06/15 08:57
# CacheRL: 基于缓存回放与混合奖励的多轮工具调用代理 来源:https://arxiv.org/html/2606.14179 Sumiran Thakur,Huancheng Chen,Su Min Park,Jiayun Wang,Gyuhak Kim Accenture 先进AI中心 (2026年6月12日) ###### 摘要 **摘要** 我们提出 CacheRL,一个用于训练小型代理基础模型的系统,在多步工具调用任务上达到了92%的过程准确率,接近GPT-5的94%,同时所需计算量减少了100倍。我们的方法解决了实际代理训练中的三个挑战:大规模转移大模型的工具调用知识、在不进行昂贵实时工具执行的情况下实现强化学习、以及从有噪声的缓存环境中稳健学习。CacheRL引入了三项关键创新。首先,一种*混合思考轨迹流水线*,用大语言模型生成的推理轨迹增强代理轨迹,生成训练样本,不仅教模型调用*什么*工具,还教*为什么*调用。其次,CacheAgentLoop通过三层模糊缓存消除了实时执行成本,同时利用令牌级掩码保持轨迹保真度。第三,一种*缓存层级感知奖励*动态调整答案质量权重,避免因缓存限制而惩罚模型。通过迭代的SFT和GRPO训练,CacheRL将Qwen3-4B-Thinking的验证奖励从0.43提升到0.78。在公开的智能代理工具调用基准上,我们的模型取得了与GPT-5等前沿模型竞争的性能。消融实验表明,移除知识转移会导致性能下降41%,而缓存感知奖励贡献了17%的提升。令人惊讶的是,强化学习提高了训练稳定性,但在强SFT基础上带来的增益有限,这表明对于构建实用的小型代理模型,数据质量和奖励设计比复杂的优化更重要。 ## 1 引言 能够利用多种工具解决复杂多步问题的自主AI代理的愿景正在迅速成为现实。GPT-5和Claude等前沿模型在编排多种工具(从代码解释器、网络搜索到API和数据库)以及在长对话中协调这些工具方面展示了令人印象深刻的能力。然而,由于计算成本、延迟约束和数据隐私问题,这些大型模型不适用于广泛部署。构建能够匹配更大模型工具调用能力的小型高效代理基础模型,对于使AI代理无处不在至关重要。关键挑战不仅在于减小模型规模,还在于保留使基础模型有价值的一般性和鲁棒性。我们需要能够处理多样化工具生态系统的小型模型,而不仅仅局限于特定领域,同时保持长程、多轮交互所需的推理能力。这需要有效地从已经通过海量训练语料学习到这些复杂行为的大模型进行知识转移。 ##### 小型代理模型的潜力与挑战。 最近的4B参数模型,如Qwen3-4B-Thinking (qwen3),表明小型模型可以通过结构化思考实现强大的推理能力。然而,将这些能力扩展到多轮工具调用面临着独特的挑战。模型必须不仅理解工具模式并生成有效调用,还要在多个轮次中保持上下文、推理工具输出并合成连贯的回复。虽然监督微调 (SFT) 可以教授基本的工具调用机制,但它在应对现实世界代理任务的组合复杂性时力不从心——在这些任务中,工具必须创造性地链接,并且错误需要优雅地处理。强化学习 (RL) 通过优化端到端的任务完成度(而非模仿演示)提供了一条前进的道路。然而,应用RL训练小型代理基础模型面临三个关键障碍: ##### 挑战1:大规模知识转移。 小型模型缺乏使大模型能够跨多种工具泛化的海量预训练。有效的知识转移不仅仅是复制工具调用,还需要捕捉工具选择和用法背后的*推理过程*。将内部推理与面向用户的输出分离开的思考模式模型 (qwen3; deepseekr1) 为这种转移提供了一种机制,但在规模上生成高质量推理轨迹同时保持实际工具执行的保真度并非易事。大多数现有代理数据集缺乏这种结构化推理,只包含表面级别的轨迹,没有解释逻辑。 ##### 挑战2:无实时执行的RL训练。 传统的RL需要与环境交互,但在训练期间进行实时工具执行是难以承受的。每次回放涉及多次API调用,伴随着延迟(每次调用数秒)、成本(API费用)和风险(意外副作用)。现代RL算法如GRPO (grpo) 在每个提示上需要相当数量的回放,且训练步骤数以千计,累计成本使得实时执行不可行。先前的工作要么局限于单轮交互 (toolrl),要么接受这些成本 (searchr1),限制了可扩展性。 ##### 挑战3:从不完美环境中学习。 为了应对挑战2而用缓存结果替代实时执行时,出现了一个新问题:缓存质量差异巨大。精确匹配提供完美的保真度,但探索过程中的新工具调用会返回近似或通用的结果。标准奖励模型会惩罚这些不匹配,产生系统性噪声,污染学习信号。模型可能因为缓存限制而不是工具选择不当而获得负面奖励——这是一个现有方法未解决的根本归因问题。 ##### 我们的方法:面向小型代理基础模型的CacheRL。 我们提出CacheRL,一个旨在通过有效的知识转移和缓存感知强化学习来训练小型代理基础模型的综合系统: 1. 通过混合思考轨迹进行知识转移(第3节 (https://arxiv.org/html/2606.14179#S3)):我们开发了一个可扩展的流水线,用GPT-5的结构化推理增强多样化的代理轨迹。该流水线智能地对现有内容进行分类,并对工具选择生成因果解释,创建了丰富的训练数据,教会小型模型工具调用背后的*为什么*,而不仅仅是*是什么*。这通过将前沿模型的推理提炼成小型模型可学习的形式来解决知识转移挑战。 2. 用于可扩展RL训练的CacheAgentLoop(第4.3节 (https://arxiv.org/html/2606.14179#S4.SS3)):我们引入了一个连接的回放机制,带有三层模糊缓存(精确、模糊、尽力而为),通过令牌级掩码消除实时执行,同时保持轨迹结构。这使得RL训练在规模上变得可行,将每次回放的成本从数美元降低到零点几分美分——同时保持足够的学习保真度。 3. 缓存层级感知奖励设计(第4.4节 (https://arxiv.org/html/2606.14179#S4.SS4)):我们的混合奖励系统根据缓存质量动态调整基于结果(LLM作为评判)和基于过程(确定性)信号之间的权重。当缓存匹配精确时,我们完全信任评判;当近似时,我们将权重转向过程指标。这防止模型因缓存限制而受到惩罚,同时在数据质量允许的情况下保持强大的学习信号。 4. 迭代训练流水线(第4.2节 (https://arxiv.org/html/2606.14179#S4.SS2) 和 4.5节 (https://arxiv.org/html/2606.14179#S4.SS5)):我们采用SFT、基于GPT-5的拒绝采样和GRPO优化的迭代循环。来自RL的高分轨迹被反馈到SFT中,形成一个良性循环,模型的最佳行为通过多种模式得到强化。这种方法将Qwen3-4B-Thinking从一个通用推理模型转变为一个有能力的代理基础模型,将验证奖励从0.43提升到0.78。 **主要贡献** 1. 首个通过缓存RL训练小型代理基础模型的系统:我们提出CacheRL,实现了对4B参数模型进行高效RL训练,用于多轮工具调用,无需实时执行,成本降低100倍。 2. 用于知识转移的混合思考轨迹流水线:一种可扩展的方法,用GPT-5的结构化推理增强轨迹,教会小型模型在1,185种独特工具中因果理解工具的使用。 3. 缓存层级感知奖励设计:基于缓存质量在结果奖励和过程奖励之间进行新颖的动态加权,解决了从不完美环境中学习时的归因问题。 4. 以2.4%模型规模实现强性能:我们的4B模型在多步工具调用上达到92%的过程准确率,接近GPT-5的94%,证明小型模型可以作为实用的代理基础模型。 ##### 关键见解。 我们对各种配置的广泛分析揭示了关于训练小型代理模型的令人惊讶的见解: - • 数据质量占主导:消融研究表明,移除高质量知识转移会导致性能下降41.2%,远超RL优化本身的影响。 - • 奖励设计很重要:移除缓存层级感知加权会导致性能下降17.2%,因为错误地将缓存限制(而非实际模型错误)惩罚了模型。 - • RL提供稳定性而非增益:虽然GRPO训练保持稳定(对多轮任务而言前所未有),但在强SFT基线之上的实际奖励提升微乎其微。 - • 规模带来泛化:在涵盖1,185种独特工具的44K多样化轨迹上训练,创建了一个能够泛化到新工具组合的基础模型,而不仅仅是记忆特定模式。 这些发现表明,通往强大小型代理模型的道路主要在于系统的知识转移和智能训练设计,而不是复杂的强化学习算法,这对该领域应聚焦的方向有重要启示。CacheRL证明了4B参数模型能够实现稳健的多轮、多工具能力,为构建可部署的代理基础模型提供了实用蓝图。 ## 2 相关工作 ##### 小型模型开发与知识蒸馏。 构建有能力的小型模型的挑战推动了知识蒸馏 (hinton2015distilling) 和模型压缩方面的广泛研究。近期工作表明,通过精心训练,小型模型(1-7B参数)可以实现显著的性能。Phi-3 (phi3) 证明了3.8B模型可以通过高质量合成数据在推理任务上匹配更大的模型。Gemma-2B (gemma) 和 Qwen3-4B (qwen3) 进一步表明,小型模型在经过策划的数据上训练后可以成为强大的基础模型。然而,这些工作主要侧重于单轮能力,如推理和代码生成。将小型模型扩展到复杂的多轮代理行为——它们必须协调多种工具并应对长程交互——仍是一个未解决的挑战,我们通过从大模型进行系统知识转移来解决这一问题。 ##### 代理基础模型与工具调用。 从语言模型到代理模型的演变代表了AI能力的根本转变。虽然GPT-5、Claude和Gemini等大模型展示了令人印象深刻的工具调用能力,但它们是通过巨大的规模(70B+参数)和在工具使用数据上的广泛训练来实现的。近期构建更小代理模型的努力包括Gorilla (gorilla),它通过检索增强专门化API调用,以及ToolAlpaca (toolalpaca),它使用自我指导技术。然而,这些模型通常专注于特定工具领域或单轮交互。我们的工作不同之处在于目标是真正的代理*基础模型*——一个能够跨多样化工具生态系统(我们训练中有1,185种独特工具)泛化,并通过结构化推理处理复杂多轮场景的模型。 ##### 用于LLM推理与工具使用的强化学习。 强化学习已成为超越监督学习提升大语言模型能力的强大技术。DeepSeek-R1 (deepseekr1) 表明,带有简单结果奖励的GRPO可以引发复杂的推理行为,确立了我们采用的迭代SFT–RL–拒绝采样循环。对于工具调用,ToolRL (toolrl) 在单轮设置中应用RL,使用Jaccard相似度作为奖励,而Search-R1 (searchr1) 通过令牌掩码扩展到多轮检索——这是我们借鉴的技术。SWE-RL (swerl) 展示了RL在软件工程任务中的应用。然而,这些工作要么运行在训练成本高昂的大模型上,要么局限于狭窄的工具领域,要么使用单轮交互。我们表明,通过基于缓存的方法和层级感知奖励,RL可以为训练小型通用代理模型变得实用。 ##### 合成数据与轨迹生成。 对于缺乏大模型海量预训练的小型模型,训练数据的质量至关重要。自我指导 (selfinstruct) 和 Alpaca (alpaca) 开创了使用大模型为小型模型生成训练数据的方法。对于代理任务,Toolformer (toolformer) 引入了自监督工具使用学习,模型用API调用注释自己的训练数据。AgentInstruct (agentinstruct) 通过程序化生成将此扩展到数百万条轨迹。我们的混合思考轨迹流水线扩展了这些方法,不仅生成工具调用,还生成其背后的*因果推理*,使用GPT-5解释为什么选择特定工具和参数。这种更深层次的知识转移——教授推理过程而不仅仅是行动——对于小型模型超越其训练分布进行泛化至关重要。 ##### 多轮RL训练中的挑战。 在多轮设置中使用RL训练代理面临着单轮设置所避免的独特挑战。当奖励跨多个步骤延迟时,信用分配变得困难 (sutton2018reinforcement)。动作空间随着可用工具和可能参数的数量组合爆炸。最关键的是,环境交互变得极其昂贵——这是先前工作中提到但未解决的问题。WebShop (webshop) 和 InterCode (intercode) 提供了模拟环境,但它们涵盖有限的工具集。我们的CacheAgentLoop通过用三层缓存系统替代实时执行解决了这个问题,使多轮RL训练在规模上变得实用,同时我们的缓存层级感知奖励确保学习信号在缓存限制下仍保持信息性。 ##### LLM作为评判与奖励建模。 使用大语言模型评估其他模型已成为常见做法 (llmasjudge),MT-Bench 显示出与人类偏好的高相关性。对于RL训练,Eureka (eureka) 使用GPT-4为机器人设计奖励函数,而Constitutional AI (constitutional) 使用AI反馈进行对齐。然而,大语言模型评判存在不一致性——相同的输出可能在不同评估中获得不同分数,在RL训练中产生噪声。我们通过混合奖励设计解决了这个问题,该设计根据缓存质量动态调整评判权重,当底层数据不可靠时减少对评判的依赖。据我们所知,这种选择性信任机制在代理的RL训练中是新颖的。 ##### 思考模式与推理轨迹。 将内部推理与外部输出分离的方法,通过链式思考提示 (cot) 普及
相似文章
KV-PRM: 通过KV缓存传输实现多智能体测试时间扩展的高效过程奖励建模
KV-PRM提出了一种过程奖励模型,利用KV缓存传输避免重新编码,在保持或提升推理基准性能的同时,实现了高达5000倍的FLOP减少。
关于智能工具调用与强化学习训练的效果与效率
本文系统分析了工具调用评估对随机种子、多轮模板等微小实现选择的敏感性,揭示这些因素可能导致性能大幅变化。同时,识别了基于强化学习的工具调用训练中的计算浪费来源,并介绍了在不牺牲性能的情况下加速训练的技术。
面向低延迟多智能体工具调用的有状态推理架构
本文提出了一种用于多智能体工具调用的有状态推理架构,该架构在多次调用之间复用KV缓存,并采用推测解码技术,相较于vLLM和SGLang,在智能体工作流上实现了2.1倍至4.2倍的加速。
面向长时程工具使用智能体任务的高效强化学习
本文介绍了 SinkFlex-RL,一个用于长时程工具使用智能体任务中内存可行的强化学习的模块化训练系统。它结合了兼容 Gymnasium 的环境封装、基于 GRPO 的策略优化,以及 sink 感知的 FlexAttention 路径,在 4096 个 token 时峰值显存降低 19.7%,并能在 eager attention 内存溢出的情况下支持 8192 个 token 的运行。
过程奖励引导的树状展开实现高效多轮强化学习
提出PaTR,一个过程奖励引导的自适应树状展开框架,用于LLM智能体的多轮强化学习。它选择性地从有希望的中间状态进行分支,并剪枝死胡同路径,在相同训练预算下,在SWE-Bench上最高提升+5.0,在FrozenLake上提升+9.3。