SKILL-KD:面向LLM智能体的对比技能蒸馏

Hugging Face Daily Papers 论文

摘要

SKILL-KD是一种对比技能蒸馏框架,通过将教师轨迹与学生轨迹之间的可操作差异蒸馏为文本技能补丁,并利用漂移感知合并机制迭代优化技能,从而提升LLM智能体的性能。

基于技能提示已成为提升大型语言模型(LLM)智能体性能的一种实用机制,然而现有的技能获取方法通常将技能视为经验总结、记忆条目或成功示范的直接摘要。这对于能力较弱的学生智能体会产生不匹配:当学生因缺乏任务知识或操作策略而失败时,其失败轨迹可能不足以推断缺失行为,而教师轨迹又可能过于隐晦,难以被内化为可复用的指导。我们提出SKILL-KD,一种对比技能蒸馏框架,将技能视为不同能力智能体之间的显式蒸馏媒介。给定同一任务上的学生失败轨迹和教师轨迹,SKILL-KD将其可操作差异蒸馏为文本技能补丁,通过重新运行学生来评估该补丁,并在学生仍然失败时迭代优化补丁。为防止重复的局部更新导致技能漂移,SKILL-KD进一步维护带轨迹链接的编辑历史,并执行漂移感知技能合并,决定每个补丁应新增规则、删除或修改现有规则,还是跳过。在五个智能体基准测试和两种学生设置下,SKILL-KD在冻结学生智能体上的表现始终优于固定模型适配基线。
查看原文
查看缓存全文

缓存时间: 2026/08/06 05:50

论文页面 - SKILL-KD: Contrastive Skill Distillation for LLM Agents

来源:https://huggingface.co/papers/2607.28048

摘要

基于技能提示已成为提升大型语言模型(LLM)智能体的一种实用机制,然而现有的技能获取方法往往将技能视为经验总结、记忆条目或成功示范的直接摘要。这会对较弱的学生智能体造成不匹配:当学生因缺乏任务知识或操作策略而失败时,其失败轨迹可能没有足够证据来推断缺失的行为,而教师轨迹又可能过于隐晦而无法被内化为可复用的指导。我们提出 SKILL-KD,一种对比性技能蒸馏框架,将技能视为不同能力智能体之间的显式蒸馏媒介。给定同一任务上的学生失败轨迹和教师轨迹,SKILL-KD 将两者的可操作差异蒸馏为文本技能补丁(skill patch),通过重新运行学生来评估该补丁,并在学生仍然失败时迭代改进补丁。为了防止重复的局部更新导致技能漂移(skill drift),SKILL-KD 进一步维护带轨迹链接的编辑历史,并执行漂移感知技能整合(Drift-Aware Skill Consolidation),决定每个补丁是应添加新规则、删除或修改现有规则,还是跳过。在五个智能体基准和两种学生设置下,SKILL-KD 一致地改进了冻结的学生智能体,优于固定模型适配基线。

查看 arXiv 页面 (https://arxiv.org/abs/2607.28048) 查看 PDF (https://arxiv.org/pdf/2607.28048) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.28048)

在您的智能体中获取这篇论文:

hf papers read 2607\.28048

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2607.28048 即可从此页面链接该模型。

引用此论文的数据集 0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2607.28048 即可从此页面链接该数据集。

引用此论文的 Space 0

没有 Space 链接此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2607.28048 即可从此页面链接该 Space。

包含此论文的收藏集 0

没有收藏集包含此论文

将这篇论文添加到一个收藏集 (https://huggingface.co/new-collection) 中,即可从此页面链接该收藏集。

相似文章

SkillCAT:对比性评估与拓扑感知的LLM智能体技能自我进化

arXiv cs.CL

SkillCAT是一个无需训练的LLM智能体技能自我进化框架,通过三个阶段解决单轨迹偏差、未经验证的合并和全语料库加载等问题:对比因果提取、评估增强进化和拓扑感知任务执行,在基准测试上实现高达40.40%的提升。