SkillCoach:自演化评分标准用于评估与增强智能体技能使用
摘要
SkillCoach提出了一种自演化评分标准框架,通过分析技能选择、遵循、组合和反思来评估并增强LLM智能体技能使用,提供了超越仅结果指标的过程级监督。
查看缓存全文
缓存时间: 2026/07/03 03:52
论文页面 - SkillCoach: 自我演化的评分标准,用于评估与增强智能体技能使用
来源:https://huggingface.co/papers/2607.01874
摘要
SkillCoach 是一个自我演化的评分标准框架,通过分析技能选择、遵循、组合与反思过程,来评估和改进智能体的技能使用,提供比仅看结果指标更优的监督能力。
技能正成为 LLM 智能体可重复使用的操作层,编码标准操作流程、领域规则、工具工作流、脚本和验证例程。在实际的技能库中,技能重叠使得可靠的技能使用(https://huggingface.co/papers?q=skill-use)变得困难。最终验证器的成功结果对于评估和训练而言都过于粗粒度——智能体可能在尝试过程中选择干扰技能、跳过必要步骤、错误组合工作流或遗漏最终检查,但仍可能通过最终验证。我们提出 SkillCoach,一个自我演化的评分标准框架,用于评估与增强智能体技能使用(https://huggingface.co/papers?q=agentic%20skill-use)。SkillCoach 从实际运行记录中推导出基于技能的过程评分标准(https://huggingface.co/papers?q=process%20rubrics),并沿四个维度评估轨迹:技能选择(https://huggingface.co/papers?q=skill%20selection)、技能遵循(https://huggingface.co/papers?q=skill%20following)、技能组合(https://huggingface.co/papers?q=skill%20composition)和基于技能的反思(https://huggingface.co/papers?q=skill-grounded%20reflection)。它保留外部验证器作为独立的结果信号,从而将过程质量与偶然的任务成功区分开。演化的评分标准进一步作为过程监督信号,用于筛选高质量的训练轨迹(https://huggingface.co/papers?q=training%20trajectories)。实验表明,演化的评分标准显著提升了评估质量,揭示了最终准确率掩盖的失败,并为增强智能体技能使用(https://huggingface.co/papers?q=agentic%20skill-use)提供了比仅用结果过滤(https://huggingface.co/papers?q=outcome-only%20filtering)更强的监督信号。
查看 arXiv 页面(https://arxiv.org/abs/2607.01874)查看 PDF(https://arxiv.org/pdf/2607.01874)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2607.01874)
在你的智能体中获取此论文:
hf papers read 2607\.01874
没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
暂无模型链接到此论文
在模型 README.md 中引用 arxiv.org/abs/2607.01874 即可从本页链接。
引用此论文的数据集0
暂无数据集链接到此论文
在数据集 README.md 中引用 arxiv.org/abs/2607.01874 即可从本页链接。
引用此论文的 Space0
暂无 Space 链接到此论文
在 Space README.md 中引用 arxiv.org/abs/2607.01874 即可从本页链接。
包含此论文的收藏集0
暂无收藏集包含此论文
将此论文添加到收藏集(https://huggingface.co/new-collection)即可从本页链接。
相似文章
SkillMaster:迈向大语言模型智能体的自主技能掌握
本文介绍了 SkillMaster,一种训练框架,使大语言模型智能体能够通过轨迹知情审查和反事实效用评估,自主地创建、优化和选择技能。
SkillCorpus: 整合与评估面向真实世界LLM智能体的开放技能生态
SkillCorpus 提出了一个框架,用于整合、精选和评估面向LLM智能体的开放技能生态,通过检索增强的技能集成,在多个基准测试中展示了一致的性能提升。
SkillAdaptor: 基于轨迹的LLM智能体自适应技能
SkillAdaptor是一种无需训练的步骤级技能自适应框架,具有显式的失败归因能力,适用于LLM智能体,在WebShop、PinchBench和Claw-Eval上提升了性能。
SkillCAT:对比性评估与拓扑感知的LLM智能体技能自我进化
SkillCAT是一个无需训练的LLM智能体技能自我进化框架,通过三个阶段解决单轨迹偏差、未经验证的合并和全语料库加载等问题:对比因果提取、评估增强进化和拓扑感知任务执行,在基准测试上实现高达40.40%的提升。
ContinualSkillBench:LLM智能体能否真正进化其能力?
介绍了ContinualSkillBench,一个用于LLM智能体上下文内持续技能学习的动态评估框架,表明虽然顺序执行能提升性能,但当前方法难以将经验巩固为稳健、可迁移的技能。