多教师策略蒸馏中工具调用边界漂移的诊断与校准

Hugging Face Daily Papers 论文

摘要

本文诊断并提出SoftClamp校准方法,可减少智能语言模型在多教师策略蒸馏中的工具调用边界漂移,在保持准确率的同时降低过度调用。

智能语言模型需要学会何时调用工具、何时消费工具响应、以及何时直接回答。这使得多教师策略蒸馏成为一种自然的训练策略:一位教师专门负责工具调用,另一位负责直接回答,学生可以在自身生成分布上从两者学习。我们表明,这种策略可能引发仅从聚合损失无法察觉的行为偏移。在双教师工具使用场景中,普通广义知识蒸馏提升了工具调用的召回率,但也导致模型趋向过度调用——在应该直接回答的样本上也调用工具。聚合解释不足以说明原因:工具调用样本并未获得更多token暴露,且工具调用教师的整序列逐token散度并非更大。我们转而分析行为杠杆不平衡:出现在模式入口和结构位置(如<tool_call>和函数名)的局部token级信号可能对全局生成模式产生不成比例的控制。我们提出Soft Clamp,一种逐token散度校准方法,动态压缩极端token级Jensen-Shannon散度,同时保留非零梯度。在APIGen-MT上,相较于普通GKD,Soft Clamp将过度调用从13.7%降至9.0%,同时保持决策准确率。在BFCL多轮诊断中,它还在GKD变体中降低了工具调用循环和重复调用。这些结果表明,多教师OPD应监控教师信号的作用位置,而不仅仅是聚合量的大小。
查看原文
查看缓存全文

缓存时间: 2026/07/21 14:37

论文页面 - 诊断与校准多教师同策略蒸馏中的工具调用边界漂移

来源:https://huggingface.co/papers/2607.07050
发布于 7月15日 · 由 shen (https://huggingface.co/jiabin) 于 7月21日提交

摘要

Agentic语言模型必须学会何时调用工具、何时消耗工具响应以及何时直接回答。这使得多教师同策略蒸馏成为一种自然的训练策略:一位教师可专精于工具调用,另一位专精于直接回答,而学生可从两者在其自身生成分布上学习。我们发现该策略可能诱发一种从聚合损失中无法察觉的行为偏移。在双教师工具使用设定中,普通广义知识蒸馏虽能提升工具调用召回率,但也使模型倾向于过度调用——即对应当直接回答的样本也调用工具。聚合解释并不充分:工具调用样本并未获得更多token暴露,且工具调用教师的整序列逐token散度并不更大。我们转而分析行为杠杆失衡:在模态入口及结构位置(如<function_name>语法和函数名)处的局部token级信号,可能对全局生成模态产生不成比例的控制。我们提出SoftClamp,一种逐token散度校准方法,可动态压缩极端的token级詹森-香农散度,同时保留非零梯度。在APIGen-MT上,相比普通GKD,SoftClamp将过度调用从13.7%降至9.0%,同时保持决策准确率。在BFCL多轮诊断中,它也在GKD变体中降低了工具调用循环和重复调用。这些结果表明,多教师OPD应监控教师信号的作用位置,而不仅关注其聚合大小。

查看arXiv页面 (https://arxiv.org/abs/2607.07050)
查看PDF (https://arxiv.org/pdf/2607.07050)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.07050)

在您的agent中获取此论文:hf papers read 2607.07050
没有最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型

0 无模型链接此论文
在模型README.md中引用arxiv.org/abs/2607.07050以在此页面建立链接。

引用此论文的数据集

0 无数据集链接此论文
在数据集README.md中引用arxiv.org/abs/2607.07050以在此页面建立链接。

引用此论文的Spaces

0 无Space链接此论文
在Space README.md中引用arxiv.org/abs/2607.07050以在此页面建立链接。

包含此论文的收藏集

0 无收藏集包含此论文
将本论文添加到一个收藏集 (https://huggingface.co/new-collection) 以在此页面建立链接。

相似文章

多教师同策略蒸馏中的行为杠杆失衡

arXiv cs.CL

本文识别了在代理语言模型的多教师同策略蒸馏中,学生模型过度依赖工具调用这一失败模式,并提出Soft Clamp方法,一种逐token散度校准方法,可在不牺牲准确率的前提下减少过度调用。

基于块策略漂移门控的在线策略蒸馏

arXiv cs.LG

本文提出了一种轻量级的基于块策略漂移门控方法,通过根据新旧学生概率变化对损失进行加权,改进了语言模型的在线策略蒸馏,在数学基准上取得了更高的推理准确性。

同策略蒸馏(5分钟阅读)

TLDR AI

本文引入同策略蒸馏,通过在教师提供的token级KL正则化下,在学生自身轨迹上训练学生模型,解决训练-推理分布不匹配问题,统一了前向KL、反向KL和JSD损失,其中反向KL更适用于较小的学生模型。