从原始经验到技能消费:模型生成智能体技能的系统研究
摘要
本文系统评估了语言智能体的模型生成技能,涵盖经验生成、提取和消耗的完整生命周期,发现技能平均有益但存在显著的负迁移,从而引出一种提高技能质量的元技能。
查看缓存全文
缓存时间: 2026/05/25 02:35
论文页面 - 从原始经验到技能消费:模型生成智能体技能的系统性研究
来源: https://huggingface.co/papers/2605.23899 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
语言智能体受益于可重用的技能,这些技能编码了特定领域的流程,但它们的有效性在不同提取和消费场景中差异显著,需要仔细评估和元技能指导以优化性能。
语言智能体 (https://huggingface.co/papers?q=Language%20agents) 通过重用技能 (https://huggingface.co/papers?q=skills)——从过去经验中提炼的结构化程序性产物——而日益改进。特别是领域级和模型生成的技能 (https://huggingface.co/papers?q=model-generated%20skills) 尤其有前景。它们通过编码领域特有的重复性流程,实现领域内的快速适应,并能超越劳动密集的手工制作进行扩展。然而,尽管提取方法不断涌现,理解仍然有限,目前尚无全面的研究贯穿整个技能生命周期——经验生成、技能提取 (https://huggingface.co/papers?q=skill%20extraction) 和技能消费 (https://huggingface.co/papers?q=skill%20consumption)——来询问这些技能 (https://huggingface.co/papers?q=skills) 是否真正有效、何时有效,以及成功或失败的原因。为填补这一空白,我们构建了一个基于效用的评估框架,跨提取器和目标智能体提供系统性实验结果,覆盖五个不同的智能体任务领域。我们发现模型生成的技能 (https://huggingface.co/papers?q=model-generated%20skills) 平均而言是有益的,但表现出非平凡的负迁移 (https://huggingface.co/papers?q=negative%20transfer),而且提取器和目标智能体的行为并不一致。一个模型可能是强提取器但弱消费者,反之亦然,技能效用与模型规模或基线任务强度无关。为解释这些模式,我们接着深入剖析每个生命周期阶段,分析经验组成如何塑造技能质量,哪些特性刻画了有用技能 (https://huggingface.co/papers?q=skills),以及同一技能如何在不同消费者间迁移。最后,我们将这些发现转化为具体的元技能 (https://huggingface.co/papers?q=meta-skill),指导技能提取 (https://huggingface.co/papers?q=skill%20extraction) 朝向与实际效用相关的特征,从而在多个领域持续提升技能质量,并大幅减少负迁移 (https://huggingface.co/papers?q=negative%20transfer)。
查看 arXiv 页面 (https://arxiv.org/abs/2605.23899) 查看 PDF (https://arxiv.org/pdf/2605.23899) 项目页面 (https://microsoft.github.io/SkillLens/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.23899)
在你的智能体中获取此论文:
hf papers read 2605\.23899
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接到此论文
在模型 README.md 中引用 arxiv.org/abs/2605.23899 以从此页面链接。
引用此论文的数据集0
没有数据集链接到此论文
在数据集 README.md 中引用 arxiv.org/abs/2605.23899 以从此页面链接。
引用此论文的 Space0
没有 Space 链接到此论文
在 Space README.md 中引用 arxiv.org/abs/2605.23899 以从此页面链接。
包含此论文的收藏0
没有收藏包含此论文
将此论文添加到收藏 (https://huggingface.co/new-collection) 以从此页面链接。
相似文章
@dair_ai: 一篇揭示代理技能的优秀论文。
这篇论文通过分析8,135次标准化试验,揭示了代理技能的本质,挑战了技能主要向模型注入知识的假设。
@dair_ai: 终于,有一篇好论文测试了 Agent Skills 是否真的有帮助。如果你正在维护技能库,值得一读 …
一项基准研究表明,在 Web 开发任务中注入 Agent Skills 通常会降低性能并增加令牌成本,存在长度分散和内容误导等失败模式,凸显了按部署评估的必要性。
揭秘代理技能:为何有效——直至失效
本文研究了技能增强LLM代理性能的条件,通过受控实验分析成功与失败因素,并提出了技能使用模式的分类法。
重新思考自我进化:一种受约束的探索-利用过程以缓解技能过拟合
本文提出SkillBoost,一种三阶段的受约束探索-利用框架,用于缓解LLM智能体自我进化中的技能过拟合。它在23个模型-基准配置上达到了最先进的性能,并证明了优化后的技能可以迁移到其他智能体。
RESOURCE2SKILL:从人类创建的多模态资源中提炼可执行智能体技能
RESOURCE2SKILL是一个框架,它将教程视频、代码仓库、文章和工件等多模态资源提炼为层次化的SkillWiki中的可执行智能体技能,相比无技能智能体,将智能体性能提升了11.9个百分点。