DART-SD: 基于钻石拓扑感知的检索与调优框架,用于多轮工具调用代理的自蒸馏

arXiv cs.CL 论文

摘要

DART-SD提出了一种拓扑感知的检索和调优框架,用于基于LLM的工具调用代理的自蒸馏,通过仅纠正关键拓扑断点并保留有效推理来提升策略多样性。

arXiv:2608.18524v1 公告类型:新 摘要:为大型语言模型(LLMs)配备多轮工具调用能力对于构建自主代理至关重要。然而,进展从根本上受限于对全长轨迹模仿的依赖。对于涉及多个顺序无关子目标的任务,最优解空间形成一个庞大的组合钻石晶格。将这种丰富的拓扑结构强制压入单一轨迹会导致严重的拓扑坍塌,不加区分地惩罚有效的替代探索,并严重降低策略多样性。为了解决这个问题,我们提出了DART-SD(基于钻石拓扑感知的检索与调优框架,用于自蒸馏),这是一个将范式从全局强制转向拓扑引导局部修正的新框架。DART-SD首先将执行过程建模为收敛的交互状态转换图(ISTG),忠实捕获成功和失败探索路径的固有钻石拓扑。在自主展开过程中,该框架识别关键拓扑断点(CTB)并检索基于成功的恢复参考。最后,我们引入了一个通过CTB引导局部监督的渐进自蒸馏范式,确保训练损失仅计算在生成的恢复步骤上,同时严格保护有效推理前缀免受破坏性梯度更新的影响。在复杂多轮工具调用基准上的实验表明,DART-SD显著优于传统的全长轨迹基线。
查看原文
查看缓存全文

缓存时间: 2026/08/20 10:12

# 面向多轮工具调用智能体自蒸馏的菱形拓扑感知检索与调优
来源:https://arxiv.org/html/2608.18524
1\]字节跳动 2\]中国科学技术大学\\贡献\[⋆\]同等贡献\\贡献\[†\]通讯作者\\通讯杨杨,宋岩

王佳瑞杨杨朱传博陈方达吴子奇蔡景铭宋岩机构:\[机构:\[邮箱:[[email protected]](mailto:[email protected])邮箱:[[email protected]](mailto:[email protected])

###### 摘要

为大语言模型(LLMs)配备多轮工具调用能力是构建自主智能体的关键。然而,其进展本质上受限于对全轨迹模仿的依赖。对于涉及多个顺序无关子目标的任务,最优解空间形成庞大的组合菱形格点。将这种丰富的拓扑结构强行压缩为单一轨迹会导致严重的拓扑坍缩,不加区分地惩罚有效的替代探索,并严重降低策略多样性。为解决此问题,我们提出了**DART-SD**(**菱**形拓扑**感知检**索与**调**优**自蒸馏**),这是一种从全局强制范式转向拓扑引导的局部修正的新型框架。DART-SD首先将执行过程建模为一个收敛的**交互状态转移图**(ISTG),忠实捕捉成功与失败探索路径的内在菱形拓扑。在自主探索过程中,该框架识别**关键拓扑断点**(CTB)并检索成功支持的恢复参考。最后,我们引入一种通过CTB引导局部监督的**渐进式自蒸馏范式**,确保训练损失仅针对生成的恢复步骤计算,同时严格保护有效的推理前缀免受破坏性梯度更新。在复杂多轮工具调用基准测试上的实验表明,DART-SD显著优于传统的全轨迹基线。

## 1引言

为大语言模型(LLMs)配备多轮工具调用能力是迈向构建能够解决复杂现实世界任务的自主智能体的重要里程碑\[32 (https://arxiv.org/html/2608.18524#bib.bib14),21 (https://arxiv.org/html/2608.18524#bib.bib15),30 (https://arxiv.org/html/2608.18524#bib.bib33)\]。通过与外部环境的连续交互,工具增强型智能体可以检索最新信息、执行代码并操作API,以超越其静态参数化知识\[4 (https://arxiv.org/html/2608.18524#bib.bib39),34 (https://arxiv.org/html/2608.18524#bib.bib24),8 (https://arxiv.org/html/2608.18524#bib.bib25),31 (https://arxiv.org/html/2608.18524#bib.bib16),3 (https://arxiv.org/html/2608.18524#bib.bib35)\]。目前,最先进的工具调用性能主要依赖于庞大且昂贵的前沿模型\[6 (https://arxiv.org/html/2608.18524#bib.bib21),1 (https://arxiv.org/html/2608.18524#bib.bib22)\]。因此,智能体蒸馏获得了重要的研究势头,旨在将这些复杂的规划和交互能力转移到高效、紧凑的开源模型中\[34 (https://arxiv.org/html/2608.18524#bib.bib24),39 (https://arxiv.org/html/2608.18524#bib.bib23),12 (https://arxiv.org/html/2608.18524#bib.bib9)\]。

参见标题图1:训练范式比较。\(a\) SFT教师增强应用不加区分的全局损失,覆盖了有效探索。\(b\) 标准RL(GRPO)通过均匀分布的奖励分配错误分配信用。\(c\) DART-SD动态识别关键拓扑断点(CTB),在保留有效探索的同时应用局部修正。当前主流的智能体蒸馏范式依赖于通过行为克隆(BC)或监督微调(SFT)进行全轨迹模仿\[22 (https://arxiv.org/html/2608.18524#bib.bib17)\]。在长期任务中,全局强制范式应用不加区分的全局损失,覆盖了学生模型的有效探索步骤\[17 (https://arxiv.org/html/2608.18524#bib.bib26)\],导致模型记忆冗余轨迹而非提取任务的核心逻辑骨架。近期的努力尝试探索基于事后回顾的脚手架或强化学习(RL)\[37 (https://arxiv.org/html/2608.18524#bib.bib1),44 (https://arxiv.org/html/2608.18524#bib.bib12),28 (https://arxiv.org/html/2608.18524#bib.bib13)\]。然而,传统的事后回顾方法\[40 (https://arxiv.org/html/2608.18524#bib.bib10)\]仍将持续的多轮交互视为严格的线性序列。这种僵化的线性性迫使模型混淆致命错误与无害探索,严重降低token效率和内部知识一致性\[18 (https://arxiv.org/html/2608.18524#bib.bib28),45 (https://arxiv.org/html/2608.18524#bib.bib27)\]。同时,标准RL方法\[26 (https://arxiv.org/html/2608.18524#bib.bib19),29 (https://arxiv.org/html/2608.18524#bib.bib44)\],如组相对策略优化(GRPO),由于奖励在所有中间工具调用上均匀分布,经常遭受信用分配错误,并无意中惩罚了失败轨迹中的有效步骤(参见图1 (https://arxiv.org/html/2608.18524#S1.F1))。

整体的SFT和标准RL范式根本上受限于将多轮工具调用过程错误地表示为一组孤立的线性轨迹\[2 (https://arxiv.org/html/2608.18524#bib.bib29),11 (https://arxiv.org/html/2608.18524#bib.bib30)\]。这种过度简化的视角忽略了状态转移的内在图结构\[9 (https://arxiv.org/html/2608.18524#bib.bib32),13 (https://arxiv.org/html/2608.18524#bib.bib31)\]。对于具有顺序无关子目标的任务,不同的轨迹经常在共享的中间状态相交,将最优解空间构建成庞大的组合菱形格点\[7 (https://arxiv.org/html/2608.18524#bib.bib34)\]。强迫模型将这种相互连接的拓扑空间扁平化为单一的线性路径,传统方法不可避免地导致严重的**拓扑坍缩**。这种结构性疏忽导致短视的信用分配\[29 (https://arxiv.org/html/2608.18524#bib.bib44)\],任意惩罚有效的替代探索,并严重降低策略多样性\[15 (https://arxiv.org/html/2608.18524#bib.bib37),41 (https://arxiv.org/html/2608.18524#bib.bib36)\]。

为与此拓扑现实对齐,我们提出了**DART-SD**,一个从线性模仿转向拓扑感知局部修正的范式转变框架。DART-SD从教师探索中提取结构先验,并实例化为覆盖成功和失败轨迹的**交互状态转移图**(ISTG)。通过将节点定义为累积交互状态而非瞬时动作,ISTG捕捉了菱形拓扑,自然解决了顺序依赖冲突。在自蒸馏过程中,DART-SD将学生状态投影到成功可达区域以识别**关键拓扑断点**(CTB)及其恢复锚点。从每个锚点出发,它在ISTG中搜索成功支持的延续作为恢复生成的参考。最后,DART-SD通过CTB引导的局部监督应用**渐进式自蒸馏范式**,确保损失仅针对恢复步骤计算,以保护有效的推理前缀。

总之,我们的主要贡献如下:
- •我们识别了现有智能体训练范式中一个基本的拓扑坍缩问题。为此,我们引入了交互状态转移图(ISTG),它通过累积交互状态表示工具执行,并捕捉由顺序无关探索引发的菱形拓扑。
- •我们通过将学生交互状态投影到经验性成功可达区域来定义关键拓扑断点(CTB)。我们提出了CTB引导的局部监督,它检索成功支持的参考,并监督生成的恢复步骤,同时严格保留有效的前缀。
- •我们提出了一种渐进式自蒸馏范式,它重复地对学生进行探索,识别其不断变化的能力边界,并执行CTB引导的局部监督。这个迭代过程使学生能够持续扩展有效的交互前缀,并逐步掌握更复杂的行为。
- •在五个基准测试和两个模型规模上的大量实验表明,DART-SD始终优于监督学习和强化学习基线,同时减少冗余工具调用并扩展有效的交互前缀。

## 2相关工作

**基于蒸馏的范式**。构建自主智能体的早期尝试依赖于在完整专家轨迹上进行行为克隆(BC)或监督微调(SFT)\[22 (https://arxiv.org/html/2608.18524#bib.bib17)\]。然而,这种全局强制范式迫使学生模仿整个序列,在长期任务中,随着偏差自回归传播,通常导致复合误差\[16 (https://arxiv.org/html/2608.18524#bib.bib11)\]。此外,不加区分的token级模仿会引发曝光偏差\[25 (https://arxiv.org/html/2608.18524#bib.bib20)\],并覆盖学生的有效探索习惯。为解决静态全局强制的局限性,近期的蒸馏方法转向以学生为中心的动态策略\[14 (https://arxiv.org/html/2608.18524#bib.bib5)\]。SCoRe-SFT\[16 (https://arxiv.org/html/2608.18524#bib.bib11)\]通过以学生为中心的知识蒸馏提供事后脚手架,而基于策略的自蒸馏(OPSD)\[44 (https://arxiv.org/html/2608.18524#bib.bib12)\]通过动态探索和蒸馏当前学生策略的轨迹来缓解离线分布偏移。类似地,基于事后回顾的蒸馏方法,如HINT-SD\[40 (https://arxiv.org/html/2608.18524#bib.bib10)\],利用有针对性的脚手架进行修正。

**强化学习范式**。为了在蒸馏之外进一步优化策略优化,强化学习(RL)方法利用环境反馈直接对齐智能体行为。诸如FTRL-GRPO\[37 (https://arxiv.org/html/2608.18524#bib.bib1)\]和ToolRL\[20 (https://arxiv.org/html/2608.18524#bib.bib38)\]等方法使用稀疏的结果奖励和可验证的执行反馈来优化智能体。然而,这些方法中的稀疏终端信号通常导致严重的信用分配错误,无意中惩罚了失败轨迹中的有效中间步骤\[27 (https://arxiv.org/html/2608.18524#bib.bib7),43 (https://arxiv.org/html/2608.18524#bib.bib8),5 (https://arxiv.org/html/2608.18524#bib.bib6),26 (https://arxiv.org/html/2608.18524#bib.bib19),37 (https://arxiv.org/html/2608.18524#bib.bib1),17 (https://arxiv.org/html/2608.18524#bib.bib26)\]。即使是更细粒度的RL方法,如MatchTIR\[23 (https://arxiv.org/html/2608.18524#bib.bib41)\],虽然通过二部图匹配对齐轨迹以提供回合级奖励,但从根本上仍将多轮交互视为刚性线性序列,从而忽略了探索的内在拓扑。相比之下,我们提出的DART-SD将范式从线性模仿和复杂匹配转向拓扑感知的局部修正。通过仅对检索到的恢复步骤计算优化损失,DART-SD严格保护有效的推理前缀免受破坏性梯度更新。

## 3方法论

参见标题图2:DART-SD概述。\(1\) DART-SD从教师探索构建ISTG,其中主节点和辅助节点建模信息获取和无用探索。\(2-3\) 收集失败的学生探索,并在同一交互状态空间中重放,然后投影到预算过滤的成功可达区域 \(R_x^+\),其中第一个可投影到不可投影的转换定义为CTB。\(4-5\) 基于保留的学生前缀和特权的教师参考,DART-SD在CTB后生成恢复延续,并仅对生成的助手token应用局部监督。\(6\) 这种CTB引导的SFT循环在自蒸馏轮次中渐进式重复。图2 (https://arxiv.org/html/2608.18524#S3.F2)提供了DART-SD框架的概述。DART-SD首先从教师探索构建ISTG,然后通过成功可达投影识别失败学生探索的CTB。识别的CTB用于生成局部恢复延续并驱动渐进式自蒸馏。

### 3\.1 ISTG抽象与构建

**信息原子抽象**。对于每个任务 \(x\),从工具响应中提取的有用事实被规范化为特定任务的信息原子集合 \(K_x\)。语义等效的响应共享相同的原子,而非信息性响应则不贡献任何原子。我们分两个阶段实现这一点。一个确定性阶段规范化每个工具响应,并决定它是否携带任务可用数据。将响应解析为字段,仅当每个字段都是状态信号或为空或占位符值时,才将其视为非信息性,因此保留单个实质性值的有效负载仍被视为信息性,而错误或未找到消息则不然。非信息性响应按工具折叠为单一类别,无需语义判断即可删除大部分语料库。

然后是一个语义阶段为存活的候选者分配原子。令 \(e\) 表示一个工具调用,具有工具标识 \(\operatorname{tl}(e)\) 和规范化响应 \(\bar{o}(e)\)。联合检查任务的所有候选者,基于任务问题和一个成功探索,产生一个集合值原子映射:
\(\alpha_{x}:\ \bigl(\operatorname{tl}(e),\bar{o}(e)\bigr)\ \longmapsto\ \alpha_{x}(e)\subseteq\mathcal{K}_{x},\qquad|\alpha_{x}(e)|\leq 1\.\) (1)信息性响应被映射到包含其原子的单元素集合,而非信息性响应或未判断的响应则映射到 \(\varnothing\)。提供相同事实的响应被约束接收相同的原子,因此 \(\mathcal{K}_{x}\) 的每个元素是一类信息等效调用的规范代表,即那些在 \(\alpha_{x}\) 下的像相同且非空的调用。联合判断任务的候选者使得这种等价性可判定:原子是在考虑所有替代方案的情况下分配的,而不是独立地标记响应并依赖标签一致。

映射 \(\alpha_{x}\) 提供了等式(4 (https://arxiv.org/html/2608.18524#S3.E4))中使用的获取增量。记 \(B_t\) 为在步骤 \(t\) 执行的工具调用或并发调用束,
\(\Delta I_{t}=\left\{k\in\mathcal{K}_{x}\;\middle|\;\exists e\in B_{t},\;k\in\alpha_{x}(e),\;k\notin I_{t-1}\right\},\qquad I_{t}=I_{t-1}\cup\Delta I_{t}\.\) (2)该构造的两个属性决定了最终的拓扑结构。首先,\(\alpha_{x}\) 跨表面形式和跨工具识别响应,因此一个工具以自由文本返回的相同事实与另一个工具以结构化记录返回的事实产生一个原子;因此,这两条获取路径会重新汇合。

相似文章

DART: 结构化工具代理的语义可恢复性

arXiv cs.AI

DART 为结构化工具代理引入了语义可恢复性,形式化了一个标准,用于确定在做出下游承诺后,本地检查点恢复是否仍然有效。在三个基于LLM的领域进行的实验表明,它正确恢复了基线本地恢复失败的所有承诺敏感案例,且安全审计未发现不安全的回滚。

通过动态Token选择实现分布对齐自蒸馏的鲁棒推理

arXiv cs.CL

提出了分布对齐自蒸馏(DASD),该方法在自蒸馏过程中动态过滤Token,以保留有益的逻辑修正,同时抑制分布不对齐的风格噪声,从而在数学、代码和常识推理基准上提升鲁棒推理能力。

HINT-SD: 面向长程智能体的目标性事后自我蒸馏

Hugging Face Daily Papers

HINT-SD 提出了一种目标性自我蒸馏框架,该框架从完整轨迹中选择与失败相关的动作,以改进长程 LLM 智能体的训练,相比密集反馈基线,性能提升高达 18.80%,训练速度提升 2.26 倍。

通过近未来引导弥合在线蒸馏中的推理轨迹

arXiv cs.CL

本文指出了在线蒸馏大语言模型时token级监督的局限性,并提出TOPD方法,利用近未来轨迹信息更好地识别发散推理状态并将引导分布到多个token上,在AIME基准测试中取得了性能提升。