GenesisFunc:面向精确且泛化的函数调用的多智能体数据生成
摘要
GenesisFunc是一个自动化多智能体管道,用于为LLM中的函数调用生成高质量、多样化的合成训练数据。在此数据上微调一个8B模型,可以在领域内和跨领域性能上取得强劲表现,与某些基于API的模型相媲美。
arXiv:2605.28835v1 公告类型:新
摘要:大语言模型(LLM)通过函数调用(FC)扩展其能力,这依赖于高质量、多样化且广泛覆盖场景的训练数据。然而,获取和标注真实的函数调用数据具有挑战性,而现有管道的合成数据常常存在API不可靠、工具可扩展性有限、多样性不足和质量控制薄弱等问题。为解决这些问题,我们提出了GenesisFunc,一个用于生成FC训练数据的自动化管道。从广泛使用的公共基准中的可靠工具出发,我们的GenesisFunc采用多智能体框架来支持一个对话生成系统,该系统能生成涵盖多样化场景的对话,同时在整个过程中保持多样性和质量。数据的准确性通过一个多阶段评估系统得到进一步加强。我们在合成数据集上微调了一个8B LLM,并通过大量实验表明,它在领域内FC性能和跨领域泛化能力上优于同规模的开源模型,同时达到了与某些最新基于API的模型相当的FC能力。此外,我们的方法展示了在下游工具上有效扩展的潜力,凸显了其实际应用价值。
查看缓存全文
缓存时间: 2026/05/29 09:12
# GenesisFunc:面向精确与泛化函数调用的多智能体数据生成 来源:https://arxiv.org/html/2605.28835 徐浩翔,邓冲1,刘嘉清1,王雯1,陈茜1,鲍露佳1,李先刚1,凌震华1 通义Fun团队,阿里巴巴集团 [email protected] ###### 摘要 大语言模型(LLMs)通过函数调用(FC)扩展其能力,而函数调用依赖于高质量、多样化且覆盖广泛场景的训练数据。然而,获取和标注真实的函数调用数据极具挑战性,现有流水线生成的合成数据往往存在API不可靠、工具可扩展性有限、多样性不足以及质量控制薄弱等问题。为解决这些问题,我们提出了**GenesisFunc**,一种自动化的FC训练数据生成流水线。从广泛使用的公开基准中的可靠工具出发,GenesisFunc采用多智能体框架支撑对话生成系统,产生覆盖多样场景的对话,同时在整个过程中保持多样性与质量。通过多阶段评估系统进一步强化数据的准确性。我们在合成数据集上微调了一个8B参数的LLM,广泛实验表明,该模型在域内FC性能和域外泛化能力上均优于同等规模的开源模型,并达到与部分最新基于API的模型相当的FC能力。此外,我们的方法在向下游工具有效扩展方面展现出巨大潜力,凸显了其实际应用价值。完整流水线及构建的数据集可在 https://github.com/famoustourist/GenesisFunc 获取。 # GenesisFunc:面向精确与泛化函数调用的多智能体数据生成 徐浩翔,邓冲1,刘嘉清1,王雯1,陈茜1,鲍露佳1,李先刚1,凌震华††感谢通讯作者。 1通义Fun团队,阿里巴巴集团 [email protected] ## 1 引言 工具学习是推动大语言模型(LLMs)前沿发展的关键一步,因为它将LLMs从被动的语言处理器转变为能够与动态环境交互的主动智能体 (Huang et al., 2024; Qin et al., 2024)。通过将内部推理与外部执行相连接,配备工具的LLMs不再受限于静态训练数据,而是能够泛化到开放式任务并适应不断变化的用户需求 (Patil et al., 2024; Qu et al., 2025)。这一范式不仅突显了在诸如工作流自动化和旅行规划等多样化应用中增强任务覆盖的实际价值 (Zhong et al., 2024; Hao et al., 2024),也彰显了扩展LLM能力基本边界的理论重要性 (Liu et al., 2024, 2025a)。 尽管工具学习取得了快速进展,该领域仍面临制约其广泛可用性的基本挑战。函数调用(FC)的有效性高度依赖于高质量的训练数据,然而收集和标注真实世界数据成本高昂且劳动密集 (Qin et al., 2024)。此外,真实世界的函数调用固有地复杂且多样,往往表现为模糊的用户意图、快速变化的动态环境、多任务需求以及延伸的多轮交互 (Tang et al., 2023; Patil et al., 2024; Liu et al., 2024; Abdelaziz et al., 2024)。这些相互交织的挑战凸显了更强大的数据生成流水线的迫切需求,以产生**精确、多样且广泛代表**真实函数调用场景的训练数据。 越来越多的研究工作致力于设计自动化流水线来合成训练数据,进而用于构建工具增强的LLMs (Qu et al., 2025; Liu et al., 2025a)。尽管取得了进展,但仍存在根本性局限。现有方法通常依赖公开可用或手动构建的API,这些API往往不可靠且难以在更广泛的工具集上扩展,从而限制了函数调用能力。此外,生成的数据常常缺乏足够的多样性和质量把控,进一步削弱了性能。从场景覆盖角度来看,大多数方法仍侧重于单轮或孤立的函数调用,无法捕捉多轮对话或多任务交互等更现实的环境。这些限制共同表明当前方法的不足,并凸显了对更有效、更可扩展的解决方案的需求。 在本文中,我们介绍了**GenesisFunc**,一个三阶段自动化流水线,旨在生成**高质量、多样且广泛代表真实场景**的函数调用训练数据。为确保API的可靠性并能无缝扩展到更广泛的工具,GenesisFunc首先从广泛采用的BFCL基准 (Yan et al., 2024) 中选择一个精挑细选的数据种子集。这些经过验证的API覆盖多个领域,不仅可靠,而且在实际应用中也易于扩展到下游工具 (Zhang et al., 2024)。接下来,为提升对话质量、多样性和覆盖率,GenesisFunc整合了一个**多智能体辅助的对话生成系统**。通过智能体的协同交互,该框架利用历史感知的角色区分和参数槽选择来扩大多样性,同时基于智能体的评分机制保障合成对话的质量。最后,为进一步确保正确性,GenesisFunc采用**多阶段评估模块**,结合基于规则和基于模型的检查,并辅以针对性的人工审查,从而保证训练数据的一致性和可执行性。通过这一端到端流程,GenesisFunc生成了健壮、多样且场景丰富的训练数据,显著增强了LLMs的函数调用能力。 为验证GenesisFunc的有效性,我们在Qwen3-8B (Yang et al., 2025) 上使用流水线生成的训练数据进行监督微调,并在多个公开基准上评估微调模型的零样本性能。由于工具来自BFCL (Yan et al., 2024),我们不仅报告域内BFCL基准的结果,还报告域外API-Bank (Li et al., 2023) 和ACEBench (Chen et al., 2025a) 的结果,从而评估域内性能和对未见领域的泛化能力。在一致的评估协议下,我们的模型持续超越同等规模的开源基线,并与基于API的模型 (OpenAI, 2023) 保持高度竞争力。此外,我们展示了该方法可以扩展到更多下游工具,并证明流水线生成的数据也可通过强化学习增强多轮对话场景中的函数调用性能。 综上所述,本文作出三个主要贡献:(1) 我们提出了GenesisFunc,一个用于为LLMs生成高质量函数调用训练数据的自动化流水线。该流水线从选择可靠API开始,集成了**多智能体对话生成模块**和**多阶段评估模块**,以确保健壮性、多样性和场景覆盖。(2) 通过广泛验证,GenesisFunc生成了**精确且多样**的数据集,同时覆盖真实场景。此外,我们的方法对下游工具表现出**强泛化能力**,凸显了其实用性。(3) 我们使用流水线生成的训练数据微调Qwen3-8B,并在三个广泛使用的基准——BFCL (Yan et al., 2024)、API-Bank (Li et al., 2023) 和 ACEBench (Chen et al., 2025a) 上评估了**GenesisFunc-8B**。GenesisFunc-8B持续优于同等规模的开源LLMs,并与基于API的模型保持高度竞争力。 ## 2 相关工作 **LLM函数调用范式。** 为LLMs配备可执行工具可带来可靠且专业的问题解决能力 (Qin et al., 2024)。现有方法主要有两种范式:提示和微调。提示利用上下文中的工具规格和示例 (Mialon et al., 2023; Hsieh et al., 2023)。ReAct (Yao et al., 2023) 将推理与API调用结合用于多步骤任务,但其性能受预训练限制,并随工具复杂度增加而下降。这些局限性促使通过监督学习或强化学习进行微调 (Tang et al., 2023; Abdelaziz et al., 2024)。代表性方法包括ToolACE (Liu et al., 2025a),它自动构建大规模工具使用语料库,以及基于RL的方法如ToolRL (Qian et al., 2025) 和AWPO (Lin et al., 2025),它们通过带有推理奖励的策略优化来增强函数调用。 **函数调用的数据合成。** 随着LLMs的发展,仅依赖人工编写的语料库不足以支持持续进步 (Bauer et al., 2024)。为在不增加大量标注成本的情况下扩大监督,近期工作采用提示驱动的转换来增强现有数据集。例如,Yu et al. (2024) 提出有针对性的提示,以从基模型中引出稀有技能和长尾行为。然而,在工具使用场景中,目的驱动的数据仍然有限。先前的工作从邻近领域适配资源 (Basu et al., 2024) 或围绕公开API合成样本 (Liu et al., 2024)。此外,ToolACE (Liu et al., 2025a) 通过自动化流水线构建大规模函数调用语料库,而ToolForge (Chen et al., 2025b) 引入了减少对真实API依赖的自动化工具使用合成。我们的工作与最相关的研究 (Qin et al., 2024; Liu et al., 2024, 2025a) 在以下方面有所区别:先前工作通常依赖标注或合成的API,这些API缺乏可靠性且难以在更大的工具集上扩展。这些方法在多样性、质量和覆盖面方面也面临限制。相比之下,GenesisFunc建立在来自公开基准的可靠工具之上,提供更强的可扩展性。此外,通过利用多智能体对话生成框架和多阶段验证系统,GenesisFunc生成的工具使用训练数据比先前工作具有更丰富的多样性、更高的质量和更广的场景覆盖。 ## 3 预定义 给定用户查询 q 和候选工具集 T = {t₁, …, tₙ},其中每个工具 tᵢ 由名称、用途描述以及指定必需参数和可选参数的模式定义,目标是选择一个工具序列并填入适当的值和单位,以生成有效的工具调用序列。该过程可形式化为: S = [t₁(a₁), …, tₖ(aₖ)] = g_φ(q, T), (1) 其中 g_φ(·) 表示参数为 φ 的 LLM,k 是调用次数,aᵢ 表示第 i 次调用的参数载荷(1 ≤ i ≤ k),即一组参数-值对,例如 aᵢ = [r₁:w₁, r₂:w₂, …, r_ℓ:w_ℓ],其中 rⱼ 为参数名称,wⱼ 为对应值。查询 q 可以是单轮或完整的多轮历史。对于微调,对 (q, T) 作为输入上下文,而黄金标准的工具调用序列 S 作为监督目标。形式上,训练样本可表示为 {⟨q, T⟩, S},其中每个训练实例将一个用户查询和候选工具与对应的工具调用序列关联起来。 见图注 图 1:GenesisFunc 的整体框架,包括从开源基准中可靠工具构建的**工具池**、**多智能体对话生成**系统和**多阶段评估**过程。 ## 4 数据生成流水线 合成数据对于增强LLMs的函数调用能力至关重要 (Liu et al., 2025a)。我们提出自动化流水线**GenesisFunc**,采用结构化的三阶段流程生成高质量的训练数据,用于工具增强的LLMs,如图1所示。首先,从公开数据集中选择可靠且功能多样的工具放入**工具池**。接着,**多智能体对话生成**模块利用多智能体辅助框架生成多样、精确且广泛代表的工具使用对话。最后,**多阶段评估**模块系统性地检查生成对话的正确性,以保证训练数据质量。 ### 4.1 工具池 增强LLM工具使用能力的训练数据质量,关键取决于底层API的可靠性和覆盖范围。然而,现有数据集往往依赖人工标注的API或手工合成的流水线,这些方法要么扩展成本高,要么难以扩展到真实世界的工具,限制了模型的泛化能力。为解决这些问题,GenesisFunc构建了一个完全来源于BFCL评估集 (Yan et al., 2024) 的精挑细选工具池。该池通过两阶段过滤过程构建:首先使用GPT-4o (OpenAI, 2023) 进行初步筛选。
相似文章
面向API调用智能体的无环境合成数据生成
本文提出了一种面向训练API调用LLM智能体的无环境合成数据生成方法,利用LLM作为即时数字世界模型生成轨迹,并在具有挑战性的基准测试上展现出显著的性能提升。
Genesis(6分钟阅读)
美国能源部与Arcee AI联合发布了Genesis-Science-1(GS1),这是一个开放权重的AI模型,专为科学计算工作流设计,并配备了一个受控执行系统,可保存可复现的记录。该项目涉及多个国家实验室的贡献,旨在帮助研究人员完成诸如高性能计算(HPC)代码现代化、模拟活动以及材料科学等任务。
面向函数的中间填充作为编码智能体基础模型的中间训练
本文提出了一种面向函数的中间填充中间训练方法,用于编码智能体基础模型,利用了函数调用与智能体动作-观察循环之间的结构相似性。该方法在SWE-Bench基准测试上,针对多种模型规模和训练后流水线均提升了性能。
ExecuGraph:一种基于执行的多智能体框架,用于利用大型语言模型进行可靠的后端代码合成
ExecuGraph是一个用于后端代码合成的多智能体框架,利用基于执行的验证和六个专用智能体来提高可靠性,尤其在更强模型(如DeepSeek-Coder-V2-Lite)上表现出增益。
一种用于全合成生存训练的过滤式生成器混合模型
本文介绍了FoGS,一种过滤式生成器混合管道,它从多个生成模型中选择合成样本来改进生存分析训练,在多个数据集上超越真实数据训练,同时保护隐私。