SkillAdaptor: 基于轨迹的LLM智能体自适应技能
摘要
SkillAdaptor是一种无需训练的步骤级技能自适应框架,具有显式的失败归因能力,适用于LLM智能体,在WebShop、PinchBench和Claw-Eval上提升了性能。
查看缓存全文
缓存时间: 2026/06/02 03:23
论文页面 - SkillAdaptor:从轨迹中实现LLM智能体的自适应技能
来源:https://huggingface.co/papers/2606.01311
摘要
带有显式故障归因的步骤级技能自适应框架,可改善LLM智能体在交互任务中的免训练技能维护。
大型语言模型(LLM)智能体日益依赖可重用的外部技能(https://huggingface.co/papers?q=reusable%20external%20skills)来解决长时交互任务。现有的免训练技能自适应(https://huggingface.co/papers?q=training-free%20skill%20adaptation)流程通常基于完整轨迹或会话级反馈来更新技能,这使得故障归因(https://huggingface.co/papers?q=failure%20attribution)较为粗糙,且往往导致不稳定或过于宽泛的修订。我们提出了SkillAdaptor,一种带有显式故障归因(https://huggingface.co/papers?q=failure%20attribution)的免训练步骤级技能自适应框架,可即插即用于OpenClaw类智能体框架。给定一条失败轨迹,SkillAdaptor会识别第一个可操作的故障步骤,将责任关联到候选技能,并在显式接受检查下应用针对性更新,同时保持骨干模型冻结。我们在WebShop(https://huggingface.co/papers?q=WebShop)、PinchBench(https://huggingface.co/papers?q=PinchBench)和Claw-Eval(https://huggingface.co/papers?q=Claw-Eval)上,使用Kimi-K2.5(https://huggingface.co/papers?q=Kimi-K2.5)、GLM-5(https://huggingface.co/papers?q=GLM-5)和GPT-5.2(https://huggingface.co/papers?q=GPT-5.2)进行评估。SkillAdaptor在所有三个套件上均优于无技能和技能自适应基线,最大单项指标提升分别为:PinchBench(https://huggingface.co/papers?q=PinchBench)平均得分%提升+1.5,Claw-Eval(https://huggingface.co/papers?q=Claw-Eval)平均得分提升+1.8,WebShop(https://huggingface.co/papers?q=WebShop)成功率提升+1.7。这些结果表明,步骤级归因能够支持更稳定、更可审计的免训练技能维护。代码将在https://github.com/zjunlp/SkillAdaptor.git发布。
查看arXiv页面(https://arxiv.org/abs/2606.01311)查看PDF(https://arxiv.org/pdf/2606.01311)添加至收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.01311)
在你的智能体中获取该论文:
hf papers read 2606\.01311
没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用该论文的模型0
暂无模型链接该论文
在模型README.md中引用arxiv.org/abs/2606.01311以从该页面链接。
引用该论文的数据集0
暂无数据集链接该论文
在数据集README.md中引用arxiv.org/abs/2606.01311以从该页面链接。
引用该论文的Spaces0
暂无Space链接该论文
在Space README.md中引用arxiv.org/abs/2606.01311以从该页面链接。
包含该论文的集合0
暂无集合包含该论文
将该论文添加至集合(https://huggingface.co/new-collection)以从该页面链接。
相似文章
SkillMaster:迈向大语言模型智能体的自主技能掌握
本文介绍了 SkillMaster,一种训练框架,使大语言模型智能体能够通过轨迹知情审查和反事实效用评估,自主地创建、优化和选择技能。
技能并非通用:面向LLM智能体的模型感知技能对齐
本文提出MASA框架,该框架在不修改模型权重的情况下,通过分层进化和模型条件重写器将技能适配到每个LLM骨干网络,相比基线方法最高提升25.8个点。
SkillCAT:对比性评估与拓扑感知的LLM智能体技能自我进化
SkillCAT是一个无需训练的LLM智能体技能自我进化框架,通过三个阶段解决单轨迹偏差、未经验证的合并和全语料库加载等问题:对比因果提取、评估增强进化和拓扑感知任务执行,在基准测试上实现高达40.40%的提升。
SkillLens:面向成本高效型大模型智能体的自适应多粒度技能复用
本文提出了 SkillLens,这是一种用于大模型智能体自适应多粒度技能复用的分层框架,在基准任务中展示了更高的准确性和成本效益。
SkillAudit:基于成对轨迹审计的无真值技能进化
SkillAudit 引入了一个框架,通过成对轨迹审计和对比评估,在没有真实反馈的情况下进化 LLM 智能体技能。该框架在 89 个任务上实现了 73.9% 的平均任务奖励,优于基线方法。