ToolGrad: 使用文本梯度高效生成工具使用数据集(3分钟阅读)

TLDR AI 论文

摘要

ToolGrad 介绍了一种使用文本梯度生成工具使用数据集的高效方法,以更低的成本实现更好的大语言模型训练,并提升在分布外任务上的性能。

Google Research 颠覆了工具使用训练数据的生成方式:ToolGrad 先构建已验证的 API 链,然后编写用户问题,而不是发明请求并期望智能体找到一个可用的路径。这种答案优先循环在 16,000 个真实 API 上达到了 99.8% 的成功率,而仅使用 500 个此类示例训练的 Gemma 3 12B 模型在工具使用测试中,面对从未见过的 API 时,达到了与 Gemini 2.5 Pro 相匹敌的性能。
查看原文
查看缓存全文

缓存时间: 2026/09/14 14:19

# ToolGrad: 用文本“梯度”高效生成工具使用数据集 来源:https://research.google/blog/toolgrad-efficient-tool-use-dataset-generation-with-textual-gradients/ 人工智能代理在自动化真实世界任务方面展现出巨大潜力,例如进行 Google 搜索、读取本地计算机文件或执行生成的 Python 脚本。要实现这种代理工作流,大语言模型需要学习如何正确高效地使用工具。为了教会大语言模型使用工具,我们需要工具使用链及其对应用户查询的数据集。在我们先前 InstructPipe(https://research.google/blog/instructpipe-generating-visual-blocks-pipelines-with-human-instructions-and-llms/)中介绍的工作里,我们手动标注了评估数据,但对于先进的大语言模型微调工作流来说,扩大人工标注规模是不切实际的。为了优化数据工作流,先前的工作,例如 ToolBench(https://arxiv.org/abs/2307.16789)和 ToolACE(https://arxiv.org/abs/2409.00920),探索了使用代理通过试错自动搜索工具使用路径。这种代表性的标注方法涉及两个步骤:\(1\) 从采样的 API 池中生成假设的用户指令,\(2\) 使用深度优先搜索(DFS)代理找到其工具使用解决方案。这种方法本质上*效率低下*,因为其核心概念是从复杂的代理探索中提炼出有价值的轨迹来训练大语言模型。 在“ToolGrad:用文本‘梯度’高效生成工具使用数据集 (https://arxiv.org/abs/2508.04086)”中,该研究在 ACL 2026 (https://aclanthology.org/2026.findings-acl.950/) 上提出,我们介绍了一种替代的解决方案范式。ToolGrad (https://github.com/zhongyi-zhou/toolgrad) 首先生成一个真实的工具使用链,然后标注其对应的用户提示。直观地说,一个明确的工具使用解决方案比提示提供了更明确的信息,使得从工具使用到使用查询的标注过程变得更容易,且仅需一个大语言模型步骤。我们的结果表明,这种“答案优先”的方法能够以更低的成本生成更复杂(长时域)的工具使用数据。使用我们生成的数据训练的大语言模型也优于使用基线方法训练的模型,甚至在未见过工具的分布外(OOD)数据集上与最先进的专有大语言模型相媲美。 ## 使用文本“梯度”迭代生成工具使用链 标准机器学习(ML)系统通过计算跨训练样本小批量的数值损失梯度来改进,然后优化算法使用这些梯度来更新模型权重。最近,TextGrad (https://arxiv.org/abs/2406.07496) 将这种范式应用于提示工程,使用大语言模型评估器以纯文本形式提供丰富、描述性的反馈——这种反馈被称为“文本梯度”。这些文本梯度随后指导将给定提示细化为能更好解决目标任务的新草案。 ToolGrad 将文本梯度的概念从提示优化应用于合成数据集生成。ToolGrad 不是优化静态文本提示,而是使用这些梯度从大型工具库中迭代地构建复杂、有效的 API 工作流。 ## ToolGrad 框架 ToolGrad 具有四个核心模块,它们按顺序进行提议、执行、选择和更新。 1. *API 提议者:*在每次迭代中,此模块将采样的 API 集缩减为几个有前景的候选 API,以扩展当前工作流。 2. *API 执行者:*这些模块并行测试选定的 API,并生成详细的执行报告。 3. *API 选择者:*此模块审查执行报告,并选择表现最佳的单个 API 调用——作为提供改进方向反馈的文本梯度——并将其附加到工作流。 4. *LLM 更新者:*最后,此模块修改合成用户查询和 AI 响应以匹配新的 API 集。 重复此迭代过程会产生一个包含用户查询、经过验证的 API 工作流和最终 AI 响应的数据样本。 ## 实验 ### 数据生成效率 我们首先评估数据生成的成本和质量。我们使用 ToolBench (https://arxiv.org/abs/2307.16789)(包含 16k+ 真实世界 API)作为我们的 API 数据库来生成工具使用数据集。我们将 ToolBench 上原始的“查询优先”数据生成方法(使用深度优先搜索(DFS))与我们的“答案优先”方法 ToolGrad 进行比较。结果表明,ToolGrad 能够以更低的生成成本、更高的通过率生成更复杂的工具使用数据。 ### 伯克利函数调用排行榜 我们使用来自 ToolBench 的 API 数据库生成了名为 ToolGrad-500 的小规模工具使用数据集。然后,我们使用 ToolGrad-500 微调了 Gemma-3 (https://arxiv.org/abs/2503.19786) 模型(1B、4B 和 12B),并将这些微调后的模型称为 ToolGrad-1B、ToolGrad-4B 和 ToolGrad-12B。我们在伯克利函数调用排行榜 (BFCL) (https://gorilla.cs.berkeley.edu/leaderboard.html) 上评估了这些模型的工具使用性能,这是一个与 ToolBench 使用不同工具集的工具使用基准测试。我们将我们的微调模型与(1)未经微调的基础模型、(2)最先进的专有模型(Gemini、GPT 和 Claude)以及(3)最先进的工具使用专用模型(ToolACE (https://arxiv.org/abs/2409.00920)、Hammer-2.1-7B (https://arxiv.org/abs/2410.04587v2))进行了比较。 以下总结了我们的发现。 - *相对于基线的持续改进*:在 ToolGrad-500 上对 Gemma-3 模型进行后训练,可以显著增强其在所有测试参数规模上的工具使用性能。 - *优于专有大语言模型*:ToolGrad-12B 模型表现出卓越的能力,得分 83.1,使其在发布时与业界最先进的专有模型 gemini-2.5-pro(83.2)、claude-4.5 Opus(82.8)以及 gpt-5(74.4)具有高度竞争力。 - *自我进化:*ToolGrad-500 数据集是使用 gemini-2.5-flash-lite 生成的。有趣的是,我们发现使用 gemini-2.5-flash-lite 生成的数据微调的 Gemma-3-12B 可以超越其原始的“教师模型”。 - *优于其他开源模型:*ToolGrad-12B 相比于其他开源的工具使用专用模型(包括在更高级 API 数据库上微调的 ToolACE)建立了明显的优势。 ## 结论与未来方向 ToolGrad 证明,通过“答案优先”范式,可以更高效、更可靠地生成高质量的工具使用数据集。通过设计一个通过文本梯度迭代链接 API 的代理框架,ToolGrad 解决了长期以来在生成真实数据方面的成本和可扩展性瓶颈。我们的设计在数据生成中实现了接近 100% 的通过率,使相对紧凑的模型能够表现出色,并表明学生大语言模型甚至可以超越其教师。 展望未来,这项研究可以通过将框架扩展到处理日益动态和庞大的 API 生态系统,以应用于更广泛、更真实的应用场景。未来的工作还将探索扩展这种自我进化能力,以支持随时间推移的个性化持续、实时学习。随着代理工作流在企业和日常任务中日益普及,像 ToolGrad 这样的框架为训练既高效能又经济可扩展部署的数字代理奠定了重要基础。 ## 致谢 *这项研究主要由 Zhongyi Zhou 在其访问研究员任期于 Google 期间进行。我们向关键贡献者 Kohei Uehara、Haoyu Zhang、Jingtao Zhou、Lin Gu、Zheng Xu、Tatsuya Harada 表示诚挚感谢,感谢他们的支持,并向 Adarsh Kowdle 和 Shahram Izadi 表示感谢,感谢他们的战略指导和深思熟虑的评审。*

相似文章

OpenVisTool:合成指导性视觉工具使用轨迹的开放方法

arXiv cs.CL

本文介绍了 OpenVisTool,一个用于合成指导性视觉工具使用轨迹的开放框架,以及相应的数据集(OpenVisTool-42K)和基准。研究表明,在基于因果关系的监督下进行微调,能在多种模型骨干上提升视觉工具使用性能。

可检索梯度:无累积权重漂移的持续后训练

arXiv cs.CL

提出 ReGrad,一种将梯度视为可检索知识单元用于持续后训练的范式,通过将文档特定梯度存储在梯度银行(Gradient Bank)中,并在推理时检索查询相关梯度进行临时权重适应,从而避免累积权重漂移。

随机渐变生成方法(2024)

Hacker News Top

本文描述了生成随机渐变图像的多种方法,包括高度图、分层径向技术和AI生成方法,并提供了OpenAI视觉标识的历史背景。