SAP:面向多轮工具使用的状态引导数据合成及参数溯源

arXiv cs.AI 论文

摘要

本文提出状态引导的数据合成与参数溯源(SAP),以改进用于训练智能体模型的多轮工具使用数据合成,并引入SAP-4B,其在性能上与更大的模型具有竞争力。

arXiv:2609.06124v1 公告类型:新 摘要:高质量的多轮工具使用数据对于训练智能体模型至关重要,但现有的数据合成方法往往低估了对长期工具使用至关重要的参数级依赖关系。因此,即使模型选择了正确的工具,任务执行仍可能失败,因为模型使用伪造的、过时的或基于弱值的参数填充工具参数。为了解决这个问题,我们提出了\textbf{状态引导的数据合成与参数溯源(SAP)}。SAP结合了状态引导、工具参数溯源约束和轮级验证,以高效构建具有长期依赖和高准确性的工具使用轨迹。使用SAP生成的数据,我们构建了SAP-4B,即使在多个基准测试中与更大的模型相比,它也具有高度竞争力。源代码、合成数据和训练权重可在https://github.com/Zichen1024/SAP获取。
查看原文
查看缓存全文

缓存时间: 2026/09/10 08:46

# 基于参数溯源的状态引导数据合成用于多轮工具使用  
来源:https://arxiv.org/html/2609.06124  
金鹏††感谢:项目负责人  
隶属:独立研究员  
邮箱:[jinpeng\.chen@my\.cityu\.edu\.hk](mailto:)  
龚程  
隶属:华为研究院  
邮箱:[liu\.rui2@huawei\.com](mailto:)  
张绥云  
隶属:华为研究院  
刘瑞††感谢:通讯作者。  
隶属:华为研究院  

###### 摘要  
高质量的多轮工具使用数据对于训练智能体模型至关重要,但现有的数据合成方法往往未能充分体现对长期工具使用至关重要的参数级依赖关系。因此,即使模型选择了正确的工具,任务执行仍可能失败,因为模型可能用虚构的、过时的或依据不足的值填充工具参数。为解决此问题,我们提出**状态引导的参数溯源数据合成(SAP)**。SAP结合状态引导、工具参数溯源约束和轮次级验证,高效构建具有远距离依赖关系且高精度的工具使用轨迹。使用SAP生成的数据,我们构建了**SAP-4B**,即使在多个基准测试中与更大的模型相比也极具竞争力。源代码、合成数据和训练权重可在 https://github.com/Zichen1024/SAP 获取。

## 1 引言  
工具使用是大语言模型(LLMs)与现实世界交互的主要接口(Patil 等,2025 (https://arxiv.org/html/2609.06124#bib.bib2);Yao 等,2024 (https://arxiv.org/html/2609.06124#bib.bib3);Barres 等,2025 (https://arxiv.org/html/2609.06124#bib.bib4))。随着LLMs部署在长期智能体系统中,多轮工具使用成为智能体能力的关键维度;然而,状态演化、工具反馈和跨轮次依赖的复杂性使得高质量多轮轨迹稀缺,这是训练智能体模型的主要瓶颈(Rabinovich 和 Anaby-Tavor,2025 (https://arxiv.org/html/2609.06124#bib.bib5);Zhang 等,2025 (https://arxiv.org/html/2609.06124#bib.bib16);Prabhakar 等,2025 (https://arxiv.org/html/2609.06124#bib.bib6))。

图1:代表性开源多轮工具使用训练集和我们的数据集上的参数依赖性统计。*平均链长*和*最大链长*表示跨轮次参数值传播链的平均和最大长度;*依赖参数比例(%)*表示涉及跨轮次依赖的参数比例。

实践中,许多多轮失败并非源于选择了错误的工具,而是源于工具参数指定错误(Rabinovich 和 Anaby-Tavor,2025 (https://arxiv.org/html/2609.06124#bib.bib5))。然而,现有的数据合成工作大多关注工具选择依赖:例如,MAGNET(Yin 等,2025 (https://arxiv.org/html/2609.06124#bib.bib9))和 FunReason-MT(Xu 等,2025a (https://arxiv.org/html/2609.06124#bib.bib7))使用预构建的工具依赖图来确保工具序列的有效性,而工具参数之间的跨轮次依赖在很大程度上被忽视。这类依赖无处不在;参数通常来自初始环境状态、先前工具调用返回值或更早的用户消息,当训练数据中此类依赖代表性不足时,所得模型会虚构上游引用、重用过时的用户输入,或在上游调用失败时产生幻觉性替代值。

为了量化这一差距,我们测量了跨轮次参数值传播链的长度和涉及此类依赖的参数比例,发现现有开源训练数据集(Liu 等,2024 (https://arxiv.org/html/2609.06124#bib.bib13);Prabhakar 等,2025 (https://arxiv.org/html/2609.06124#bib.bib6))在这两方面均始终表现浅显¹,使得模型在复杂多轮任务中容易出错(Rabinovich 和 Anaby-Tavor,2025 (https://arxiv.org/html/2609.06124#bib.bib5))。

> ¹ 图1 (https://arxiv.org/html/2609.06124#S1.F1) 中统计数据的样本量:ToolACE 11k,APIGen-MT 5k,SAP(我们) 9k。

除了溯源问题,现有方法还面临轨迹准确性与生成成本之间的艰难权衡。目前主导的是两种范式。**意图优先**方法(Qin 等,2024 (https://arxiv.org/html/2609.06124#bib.bib12);Prabhakar 等,2025 (https://arxiv.org/html/2609.06124#bib.bib6);Xu 等,2025b (https://arxiv.org/html/2609.06124#bib.bib10);Zeng 等,2026 (https://arxiv.org/html/2609.06124#bib.bib14);Chen 等,2026 (https://arxiv.org/html/2609.06124#bib.bib36);Xu 等,2026b (https://arxiv.org/html/2609.06124#bib.bib11))先草拟用户意图,再事后扩展对话和工具调用;其验证通常结合基于规则的蓝图检查(模式、类型、可执行性)和LLM委员会审查。由于底层LLMs的可靠性有限,这种验证无法完全保证准确性,并且即使轨迹包含局部正确的子序列,单个检查失败也常导致整个轨迹被丢弃。**轨迹优先**方法(Yin 等,2025 (https://arxiv.org/html/2609.06124#bib.bib9);Xu 等,2025a (https://arxiv.org/html/2609.06124#bib.bib7);Hao 等,2026 (https://arxiv.org/html/2609.06124#bib.bib8))在工具依赖图上采样可执行轨迹,并从中推导用户查询;这提供了强大的可执行性保证,但将图与源工具生态系统耦合,使得迁移到新领域的成本高昂。

为解决这些问题,我们提出**状态引导的参数溯源数据合成(SAP)**。给定一个工具集及其文档,SAP动态构建一个**有限状态机(FSM)**,其边已携带每个参数的溯源标签;然后从FSM中采样状态转移轨迹,并逐轮填充工具参数。依赖先前上下文的参数会根据已执行的历史进行验证,每个工具调用在生成后立即执行。如果调用失败,只会重试有问题的调用,而不是丢弃整个轨迹。一旦调用序列确定并验证通过,框架生成相应的自然语言用户和助手消息。通过结合状态转移引导、参数溯源感知和即时工具调用验证,SAP同时支持可执行性、参数的因果一致性和跨领域可扩展性,实现高质量与高效率。

使用SAP合成的数据,我们训练了**SAP-4B**,在BFCL v4多轮(Patil 等,2025 (https://arxiv.org/html/2609.06124#bib.bib2))和τ²-bench零售/航空(Barres 等,2025 (https://arxiv.org/html/2609.06124#bib.bib4))上均取得了有竞争力的结果。为支持未来研究,合成代码、合成数据和训练权重在 https://github.com/Zichen1024/SAP 公开。

我们的主要贡献如下:
- • 我们为多轮工具使用数据引入了参数溯源诊断,表明现有开源数据包含浅层依赖链和少量依赖先前轮次的参数,限制了其对学习远距离参数跟踪的支持。
- • 我们提出SAP,一种状态引导的合成框架,它从工具文档动态构建FSM,将参数溯源作为显式约束,并逐轮验证工具调用,从而能够高效构建具有强因果依赖关系和高正确性的多轮工具使用数据。
- • 我们表明SAP-4B在BFCL v4多轮和τ²-bench上均取得了有竞争力的结果;消融研究进一步证实了每个组件的重要性。

## 2 相关工作  
#### 多轮工具使用数据合成  
高质量的多轮轨迹合成是工具增强LLMs的主要瓶颈(Patil 等,2025 (https://arxiv.org/html/2609.06124#bib.bib2);Yao 等,2024 (https://arxiv.org/html/2609.06124#bib.bib3);Barres 等,2025 (https://arxiv.org/html/2609.06124#bib.bib4);Prabhakar 等,2025 (https://arxiv.org/html/2609.06124#bib.bib6);Xu 等,2025a (https://arxiv.org/html/2609.06124#bib.bib7);Guan 等,2025 (https://arxiv.org/html/2609.06124#bib.bib37);Hao 等,2026 (https://arxiv.org/html/2609.06124#bib.bib8);Li 等,2025 (https://arxiv.org/html/2609.06124#bib.bib21);Xu 等,2026a (https://arxiv.org/html/2609.06124#bib.bib22);Chai 等,2026 (https://arxiv.org/html/2609.06124#bib.bib38);Su 等,2026 (https://arxiv.org/html/2609.06124#bib.bib20))。

**意图优先范式**从用户意图开始,事后扩展工具调用,实例化为在大型API池上的DFS规划(Qin 等,2024 (https://arxiv.org/html/2609.06124#bib.bib12))、经基于规则检查和LLM委员会验证的结构化蓝图(Prabhakar 等,2025 (https://arxiv.org/html/2609.06124#bib.bib6))、带掩码填充细化的非自回归骨架(Zeng 等,2026 (https://arxiv.org/html/2609.06124#bib.bib14))、为对话一致性进行图采样规划生成(Wang 等,2025b (https://arxiv.org/html/2609.06124#bib.bib31))、大规模用户侧意图建模(Cho 等,2026 (https://arxiv.org/html/2609.06124#bib.bib35))、从真实世界MCP环境扩展工具使用合成(Xu 等,2025b (https://arxiv.org/html/2609.06124#bib.bib10)),或从原始文本蒸馏隐式工具使用意图(Xu 等,2026b (https://arxiv.org/html/2609.06124#bib.bib11))。

**轨迹优先范式**在工具依赖图(手工策划、签名派生或执行演化)上采样可执行轨迹,并根据这些轨迹推导用户查询(Yin 等,2025 (https://arxiv.org/html/2609.06124#bib.bib9);Xu 等,2025a (https://arxiv.org/html/2609.06124#bib.bib7);Hao 等,2026 (https://arxiv.org/html/2609.06124#bib.bib8);Tian 等,2026 (https://arxiv.org/html/2609.06124#bib.bib33))。

最近的一条**溯源感知规划**路线,以ToolWeave(Khandelwal 等,2026 (https://arxiv.org/html/2609.06124#bib.bib15))为代表,在规划时构建具有内置依赖关系的工具并跟踪参数溯源,以减少参数幻觉。相比之下,SAP将类型系统扩展为五类(P_i, P_o, P_c, P_u, 以及仅运行时的P_f),并要求在绑定之前根据执行器状态解析每个声明的源,无需预构建或演化的依赖图,在合成时而非事后强制参数级因果一致性。沿类似思路,ToolMind(Yang 等,2025b (https://arxiv.org/html/2609.06124#bib.bib29))在生成后应用逐轮过滤以捕获跨轮次传播的错误,而SAP将检查从后置过滤提升为合成时约束。InfTool(Li 等,2025 (https://arxiv.org/html/2609.06124#bib.bib21))通过外层循环GRPO协同演化合成数据和训练模型,而SAP将执行器循环保持在单次合成过程中,并生成固定的SFT数据。

#### 多轮工具使用基准  
多个基准测试针对多轮工具使用。BFCL v4(Patil 等,2025 (https://arxiv.org/html/2609.06124#bib.bib2))是采用最广泛的基准之一;其多轮赛道分为基础、长上下文、缺失参数和缺失功能子集,以探测不同能力。τ-bench系列(Yao 等,2024 (https://arxiv.org/html/2609.06124#bib.bib3);Barres 等,2025 (https://arxiv.org/html/2609.06124#bib.bib4))构建了状态感知的零售/航空对话,要求智能体在LLM模拟的用户下,在长时段内维持连贯的世界状态。ToolDial(Shim 等,2025 (https://arxiv.org/html/2609.06124#bib.bib32))和DialogTool(Wang 等,2025a (https://arxiv.org/html/2609.06124#bib.bib34))提供了互补的多轮/有状态工具使用数据集。Rabinovich 和 Anaby-Tavor(2025)(https://arxiv.org/html/2609.06124#bib.bib5) 揭示了在分布偏移下函数调用的脆弱性,Zhang 等(2025)(https://arxiv.org/html/2609.06124#bib.bib16) 更广泛地调查了多轮LLM交互。请参见图注。

图2:SAP流程概览。从左到右,A_FSM 从工具文档和采样初始状态构建FSM,流程从中采样状态轨迹。A_plan 用具体参数填充带标签的调用 Tool(tag),生成 Tool(p),并用ε执行,使用环境回滚和失败时的局部重试。最后,A_msg 为已验证的轨迹合成消息,并过滤到最终数据。每个参数被分配一个来自 {P_i, P_o, P_c, P_u, P_f} 的溯源。

## 3 预备知识  
### 3.1 任务定义  
我们将多轮工具使用数据合成形式化为**部分可观测马尔可夫决策过程(POMDP)**,定义为元组 M = (S, A, O, T),其中 S 是潜在环境状态空间(工具执行环境的世界状态,例如数据库内容或会话上下文);A = A_tool ∪ A_resp 是动作空间,A_tool 涵盖工具调用,A_resp 涵盖自然语言响应;O 是观测空间,包含工具返回值 r ∈ R 和用户消息 u;T(s_{t+1} | s_t, a_t) 是由接地执行器 ε 实现的随机转移函数。轨迹 τ = [(o_1, a_1), ..., (o_T, a_T)] 记录了完整的观测-动作对序列。由于智能体无法直接读取潜在环境状态 s,它必须基于 c_0(通过只读工具返回值或用户消息中转的值间接访问)、先前的工具调用返回值 r 或更早的用户消息 u 来接地参数。合成目标是生成数据集 D = {(c_0^{(i)}, U^{(i)}, GT^{(i)})}_i,其中 U^{(i)} = (u_k^{(i)})_k 是逐轮用户消息序列,使得每个参数值 v 携带一个显式声明的、可由执行器验证的因果源。

### 3.2 FSM 定义  
虽然上述POMDP捕获了完整的环境动态(工具执行状态、返回值、用户消息),但FSM在对话阶段层面对之进行抽象:每个FSM状态代表交互的一个可识别阶段,而非具体的环境配置。SAP将这种高级对话结构建模为**有限状态机(FSM)**:F = (Σ, σ_0, Σ_f, Δ),(1) 其中 Σ 是一组*对话阶段*状态,每个状态实例化预定义、领域无关的状态类型分类法(附录A.1 (https://arxiv.org/html/2609.06124#A1.SS1))的一种类型,σ_0 ∈ Σ 是初始状态,Σ_f ⊆ Σ 是接受终止状态集,Δ 是有向转移边集。该分类法在领域间固定,而F的具体状态和边在合成时针对每个工具集生成。

#### 状态  
每个 σ ∈ Σ 描述用户-智能体交互的一个*阶段*,而非工具级的执行依赖。例如,Σ包括:σ_init(会话已开启)、σ_logged_in(用户已认证)和σ_searc...

相似文章

SPADE:自适应合成可执行环境中的自我博弈

Hugging Face Daily Papers

SPADE 引入了一种针对语言模型的自我博弈强化学习框架,该框架生成自适应的可执行训练环境,以增强推理和工具使用能力,并在多个基准测试中展示了显著的性能提升。

@neural_avb: https://x.com/neural_avb/status/2072294078805684613

X AI KOLs Timeline

本论文介绍了Autodata,这是一种利用智能“数据科学家”AI的方法,通过迭代生成、验证和优化来自动创建高质量合成数据集,该方法特别针对强化学习(GRPO)进行了优化,以提升语言模型的推理能力。

生成更好训练数据的智能体(25分钟阅读)

TLDR AI

Autodata 引入了一种智能体数据科学家,它能够迭代生成并优化合成训练数据,并通过元优化进一步提升数据质量,在计算机科学和法律推理任务上取得了更好的效果。

SKT:通过验证合成数据生成实现规模化技能使用训练

Hugging Face Daily Papers

介绍了SKT,一个用于语言模型智能体技能使用训练的验证数据合成流水线,从2,000个公开技能中生成4,000个任务包和27,164条经验证的轨迹。在SKT生成的轨迹上进行监督微调,能够持续提升不同模型和智能体框架的技能使用性能。