SFT 还是 RL 用于工具调用代理?一项跨数据、方法和规模的对照研究
摘要
这项对照研究比较了监督微调和强化学习方法在不同数据集和模型规模下训练工具调用代理的表现,发现SFT结合LoRA在分布内表现最强,而RL在跨数据集迁移中略有优势。
arXiv:2609.17848v1 Announce Type: new
摘要:关于训练数据、适应方法和模型规模如何共同影响语言模型代理的工具调用性能,现有的对照证据有限。我们评估了使用LoRA的监督微调(SFT)、通过群组相对策略优化(GRPO)的强化学习(RL),以及SFT后接GRPO的方法,在六个从0.6B到32B参数的Qwen3模型上进行,涵盖了分布内性能和跨数据集迁移。SFT结合LoRA在整个0.6B-32B范围内是分布内最强的方法,并且在18个实验设置中的15个中表现最佳。在跨数据集迁移中,方法表现更接近:GRPO在训练和测试数据集不同的54个设置中赢了29个,但其相对于SFT的平均优势不到一点,而SFT->GRPO在两种比较中都很少是最强的。数据集混合提供了持续强劲的迁移性能,同时接近专门的分布内训练,无论使用何种方法。额外的分析进一步证实LoRA优于全参数微调,表明LoRA更好地保留了预训练的代理行为。
查看缓存全文
缓存时间: 2026/09/17 08:59
# 监督微调还是强化学习用于工具调用智能体?一个涵盖数据、方法与规模的可控研究 来源:https://arxiv.org/html/2609.17848 ###### 摘要 关于训练数据、适配方法与模型规模如何共同影响语言模型智能体的工具调用性能,目前仍缺乏充分的可控证据。我们评估了使用LoRA的监督微调(SFT)、基于群组相对策略优化(GRPO)的强化学习(RL)、以及SFT后接GRPO的策略,在六个规模从0.6B到32B的Qwen3模型上进行实验,覆盖了同分布性能与跨数据集迁移能力。在0.6B–32B范围内,使用LoRA的SFT始终是最强的同分布方法,并在18个实验设置中的15个取得最佳表现。在跨数据集迁移任务上,各方法差距较小:在训练集与测试集不同的54个设置中,GRPO在29个设置中获胜,但其相比SFT的平均优势不到一个百分点,而SFT→GRPO在两种对比中都很少成为最强策略。数据混合策略在保持接近专用同分布训练效果的同时,始终能带来较强的迁移能力,且不受具体方法影响。进一步分析表明,LoRA持续优于全参数微调,说明LoRA能更好地保留预训练的智能体行为。 ## 1 引言 工具使用是语言模型智能体的核心能力,使其能够检索外部信息、与环境交互并执行计划中的行动(Yao et al., 2022;Schick et al., 2023;Li et al., 2023)。可靠的工具使用需要选择合适的函数并生成参数正确的有效调用;此环节的失败可能阻碍需要外部操作的任务完成(Li et al., 2023;Patil et al., 2024)。尽管工具调用至关重要,但针对工具调用模型训练的实用指导仍然有限,因为现有研究通常未能清晰分离训练数据、训练后策略与模型规模的影响。此外,从头构建足够大且多样化的工具调用数据集成本高昂,因此现有公开语料库成为模型适配的实际起点(Laskar et al., 2026)。从业者因此必须共同决定:(i)使用哪个工具调用语料库,(ii)是否应用监督微调(SFT)、强化学习(RL)或SFT后接RL,以及(iii)所选策略在目标部署规模下是否仍然有效。 为填补这一空白,我们在多个工具调用训练语料库与模型规模下,对三种训练后策略进行可控对比:SFT、直接应用于指令微调模型的RL、以及SFT后接RL。我们使用LoRA(Hu et al., 2022)进行SFT,并使用群组相对策略优化(GRPO)(Shao et al., 2024)实现基于RL的策略。实验采用三个公开工具调用数据集:xLAM/APIGen 60k(Liu et al., 2024)、ToolACE(Liu et al., 2025)和Glaive-FC-v2(Glaive AI, 2023),以及三者的均匀混合数据集。我们在六个不同规模的Qwen3模型(Yang et al., 2025)上评估这些策略,规模从0.6B到32B。为确保可控且公平的比较,我们对所有数据集采用相同的提示格式,并去除潜在重复样本以降低训练集与测试集之间的数据污染风险(Ravaut et al., 2025)。对于SFT→GRPO,每个训练集在两个阶段间平均无重叠划分。我们在所有三个数据集的留出测试集上评估每个模型,这使我们能够研究跨数据集迁移能力。该设计让我们得以探究以下研究问题(RQ):(RQ1)SFT与GRPO在不同规模、同分布及迁移任务中的比较;(RQ2)训练语料库选择对性能与迁移的影响,独立于具体方法。 **主要发现**。我们得出四个结论。首先,在整个0.6B–32B规模范围内,使用LoRA的SFT提供最可靠的同分布性能,并在所有18个设置中均优于零样本基线。在这些对比中,使用LoRA的SFT在15个设置中取得最高准确率,而GRPO仅在2个设置中表现最佳,SFT→GRPO仅在1个设置中最佳。其次,GRPO在跨数据集迁移中具有微弱优势。在训练集与测试集不同的54个设置中,GRPO在29个设置中取得最高准确率,SFT在19个设置中最佳,SFT→GRPO在6个设置中最佳。然而,GRPO相比SFT的平均优势不足一个百分点。第三,在匹配的数据预算下,结合SFT与GRPO并未带来一致的收益,且在同分布性能或跨数据集迁移中都很少成为最强策略。最后,训练语料库的选择与适配方法同等重要,可使同分布准确率变化高达55个百分点。均匀混合数据集提供了最强的整体部署默认选项,在保持接近最佳同分布专家性能的同时,实现了最佳的迁移性能。我们还对比了LoRA与全参数微调(全量SFT),发现LoRA始终优于全量SFT,表明其能更好地保留预训练的工具使用能力。 表1:去除近重复样本后的训练数据统计。 ## 2 相关工作 **智能体语言模型中的工具使用**。工具调用使语言模型智能体能够与外部系统交互,并执行通过规划、记忆和推理产生的行动(Yao et al., 2024)。可靠执行要求模型选择合适的工具并生成参数正确的有效调用(Laskar et al., 2026)。多个数据集支持训练此能力,但其构建方式与交互模式差异显著。APIGen/xLAM(Liu et al., 2024)提供6万个经过验证的单轮示例,涵盖4,211个API;ToolACE(Liu et al., 2025)使用多智能体、自进化合成方式生成涉及多轮交互、并行调用与工具使用拒绝的对话,覆盖26.5k个API;而Glaive-FC-v2(Glaive AI, 2023)包含11.3万个将普通对话与函数调用相结合的对话示例。尽管存在这些差异,关于训练语料库选择如何影响同分布性能及向其他工具调用数据集迁移的证据仍有限。 **用于工具使用的强化学习**。近期研究表明强化学习可以提升工具调用性能。ToolRL(Qian et al., 2025)直接对指令微调模型应用GRPO,使用独立评估输出格式、工具选择和参数正确性的奖励。在参数为1.5B、3B和7B的Qwen2.5模型上,该研究表明这种“从指令到强化学习”的方法通常优于对应的基座模型和SFT模型,尽管收益在不同模型和基准测试间有所差异。Nemotron-Tool-N1(Zhang et al., 2025)类似地对Qwen2.5模型应用GRPO,使用R1风格的二元奖励(Guo et al., 2025),要求同时具备有效的推理格式和正确的工具调用。其7B和14B模型在BFCL和API-Bank上优于多个现有SFT基线。然而,这两项研究都未能系统地在广泛的模型规模与训练语料库范围内,将RL与匹配的参数高效SFT基线进行比较。我们的结果提供了从0.6B到32B参数的此类比较:使用LoRA的SFT在同分布任务上始终更强,而GRPO在跨数据集迁移中仅提供微弱优势。 表2:所有模型×训练数据集×方法组合在三个留出测试子集(xLAM、ToolACE=TA 和 Glaive=GL)上的精确匹配准确率(%),以及零样本基线。粗体表示每个训练数据设置中的最佳方法。在每个模型规模内,蓝色、橙色和绿色分别表示在xLAM、ToolACE和Glaive上的最佳结果。红色表示同分布结果低于对应零样本基线。并列最佳结果均已高亮显示。 ## 3 实验设置 ### 3.1 数据 我们在本文中使用以下三个数据集:xLAM(Liu et al., 2024)、ToolACE(Liu et al., 2025)、Glaive-FC-v2(Glaive AI, 2023)。我们将所有数据集转换为包含工具定义、消息和参考调用的通用格式。为防止训练集、验证集和测试集之间重叠,我们首先基于标准化的用户查询和工具名称从每个语料库中去除近重复样本,然后再进行划分。此操作从Glaive中移除了65,256个示例,超过原始语料库的一半。使用固定种子,我们从每个来源中保留1,000个示例用于测试,500个用于验证;表1总结了得到的数据。我们还使用了一个数据集混合版,其中包含从每个来源随机抽取的最多20,000个训练示例(如果任何数据集样本少于20,000,则使用该数据集中的所有实例)。对于SFT→GRPO,我们将每个训练集平均无重叠划分:一半用于SFT,另一半用于GRPO。因此每个示例仅出现在一个训练阶段,保持不同方法间的总训练数据量一致。我们使用相同的系统提示和工具格式进行训练和评估,确保性能差异源于训练方法而非提示格式差异。附录A.1提供了提示和序列化格式。 ### 3.2 训练 **SFT**。我们在所有从0.6B到32B参数的模型规模上应用LoRA(r=32, α=64),依据是LoRA能比全参数微调更好保留预训练能力的证据(Biderman et al., 2024)。我们使用LLaMA-Factory(Zheng et al., 2024)实现,使用余弦学习率调度、bf16精度,仅在助手轮次上计算损失,最多训练两个周期。详细超参数见附录A.2。 **GRPO**。我们使用组大小为8、KL系数为0.001、训练批量大小为256、小批量大小为64,训练两个周期。我们使用verl(Sheng et al., 2024)实现GRPO,并使用vLLM(Kwon et al., 2023)生成训练响应。附录A.3提供了完整的训练和展开设置。奖励结合输出格式有效性、工具名称正确性和参数正确性,权重分别为0.2、0.3和0.5。该奖励对正确参数给予部分分数,惩罚额外参数,并奖励模型正确预测何时不应调用工具。完整的奖励定义见附录A.4。 **SFT→GRPO**。该策略在一半训练数据上执行冷启动SFT(LoRA适配器合并到基座权重中),然后在不相交的剩余一半上应用GRPO。所有训练任务均在谷歌Kubernetes引擎(GKE)上运行,使用配备8×H200-141GB GPU的单节点。评估在配备8×A100-80GB GPU的机器上进行,使用数据并行vLLM解码(温度0)(附录A.5)。 ### 3.3 评估与指标 每个模型在所有数据集的留出测试子集上进行评估。我们报告精确匹配率,定义为所有标准调用被复现的样本比例(Laskar et al., 2025b)。我们编写解析脚本,通过比较LLM生成响应中的工具调用与标准工具调用来测量工具调用正确性(Laskar et al., 2023; Laskar et al., 2024a; Laskar et al., 2024b; Laskar et al., 2025a)。我们使用相同的评分函数计算这些指标和GRPO奖励,确保训练信号与评估指标完全一致。我们在比较前还对值进行标准化(例如,将数字字符串视为等同于数字,进行大小写不敏感比较),以避免对等效表示进行惩罚。 ## 4 结果 表2总结了我们的实验结果。 ### 4.1 RQ1:SFT与GRPO在不同规模上的比较 **同分布性能**:SFT在所有18个设置中均优于零样本基线,在0.6B时增益高达20个百分点(xLAM:66.0%→85.6%)。它也是整体最强的同分布方法,在18个设置中的15个取得最佳结果,而GRPO仅在2个设置中最佳,SFT→GRPO仅在1个设置中最佳。GRPO和SFT→GRPO分别在1个和3个设置中低于零样本基线,而SFT从未出现这种情况(表2)。 在跨数据集迁移任务中,各方法更具竞争力。在训练集与测试集不同的54个设置中,GRPO在29个设置中取得最佳结果,SFT在19个设置中最佳,SFT→GRPO在6个设置中最佳。然而,GRPO相比SFT的平均优势不足一个百分点。 我们还对比了4B参数规模下LoRA与全参数微调的表现,此规模下从业者可能在现实环境中部署智能体模型(Belcak et al., 2025)。LoRA在所有三个数据集上表现更佳:xLAM上为88.0% vs 80.4%,ToolACE上为30.4% vs 22.8%,Glaive上为47.6% vs 44.1%。LoRA也是此规模下唯一从未低于零样本基线的策略,与LoRA比全参数训练能更好保留预训练能力的证据一致(Biderman et al., 2024)。 ### 4.2 RQ2:数据集影响与迁移 训练数据集的选择在不同模型规模上影响大体一致,其对性能的影响与训练方法相当(图1,按SFT with LoRA跨规模平均)。在ToolACE和混合数据集上训练的模型能很好地迁移到xLAM,分别达到75.3%和82.5%,而零样本平均为73.7%。相比之下,在Glaive上训练的模型在xLAM上仅达到64.8%,低于零样本基线。这表明Glaive较窄的、主要是单次调用的格式可能不易迁移到其他工具调用场景。ToolACE是最难……(内容截断)
相似文章
论SFT的泛化:强化学习视角与奖励修正
本文从强化学习的视角分析了标准监督微调(SFT)的局限性,并提出了一种简单的梯度重新缩放方法——动态微调(DFT),该方法提高了LLM的泛化能力,并与离线RL性能相匹配。
跨对齐训练、模型生物和玩具模型的共享SFT经验
本文研究将关于监督微调(SFT)的经验跨对齐训练、模型生物和玩具模型进行迁移,表明像基于行为原因的训练和混合模型内数据等技术可以改善泛化性和能力保持。
关于智能工具调用与强化学习训练的效果与效率
本文系统分析了工具调用评估对随机种子、多轮模板等微小实现选择的敏感性,揭示这些因素可能导致性能大幅变化。同时,识别了基于强化学习的工具调用训练中的计算浪费来源,并介绍了在不牺牲性能的情况下加速训练的技术。
面向临床智能体的世界反馈:在FHIR环境中诊断强化学习
本文研究了在FHIR环境中为临床协议执行任务使用来自世界反馈的强化学习,识别了诸如高静默完成上限和零梯度任务等结构性障碍,并引入了具有更低上限的MedAgentBench-v3。它表明,由于这些障碍,纯强化学习表现不如基于规则的SFT,并提出了一种结合SFT+RL的方法。
学习该学什么:面向小语言模型SFT-then-RL推理的分阶段专属数据集
本文提出了一种难度感知的SFT-then-RL框架,用于在推理任务上训练小语言模型(参数量≤3B),核心观点是数据难度应与SFT(学习新技能)和RL(巩固已有技能)各自的不同角色相匹配。作者为困难SFT样本引入了Bridge机制,并针对RL失败案例提出了Critique Fine-Tuning方法,在五个推理基准测试上均取得了一致性提升。