OpenSkillEval:自动审计面向LLM智能体的开放技能生态系统

arXiv cs.CL 论文

摘要

OpenSkillEval是一个自动评估框架,用于审计LLM智能体在多个下游任务中使用的开源技能。通过使用超过600个动态生成的任务和30项技能,作者发现技能的可用性并不保证有效使用,其收益在很大程度上取决于模型和框架。

arXiv:2605.23657v1 公告类型:新 摘要:技能,即为大型语言模型(LLM)提炼的结构化工作流指令,正成为提升智能体在真实下游任务中性能的重要机制。然而,随着开源技能生态系统的迅速扩展,不同模型和智能体框架如何与技能交互、如何评估技能质量、以及用户在实际成本效益权衡下应如何选择技能,这些问题仍不明确。在本文中,我们提出了 \textsc{OpenSkillEval},一个用于评估技能增强型智能体系统及其技能本身的自动评估框架。\textsc{OpenSkillEval} 不依赖静态基准,而是从不断演变的真实世界制品中自动构建实际任务实例,涵盖五类下游应用:演示文稿生成、前端网页设计、海报生成、数据可视化和报告生成。它还收集并整理了社区贡献的技能,以便在统一的任务设置下进行受控比较。通过使用超过600个动态生成的任务实例和30个开源技能,我们对最先进的模型和智能体框架进行了系统评估。结果表明,技能的可用性并不能保证有效的技能使用,技能增强的收益在很大程度上取决于底层模型和智能体框架,并且许多广受欢迎的技能并不总能稳定地超越未使用技能的基智能体。这些发现凸显了动态、基于任务评估的必要性,并为LLM智能体技能的设计、选择和部署提供了实用见解。更多案例和基准资源可在项目网站获取:https://yingjiahao14.github.io/OpenSkillEval-Web/。
查看原文
查看缓存全文

缓存时间: 2026/05/25 09:02

# OpenSkillEval:为LLM智能体自动审计开放技能生态系统 来源:https://arxiv.org/html/2605.23657 贾皓穎1,艾柏贤2,唐伟3,刘思远2,曹艺馨2 1新加坡管理大学 2复旦大学可信具身人工智能研究院 3京东未来学堂 ###### 摘要 技能(即为大型语言模型(LLM)提炼的结构化工作流指令)正成为提升智能体在现实下游任务中表现的重要机制。然而,随着开源技能生态系统的迅速扩张,不同模型和智能体框架如何与技能交互、如何评估技能质量、以及用户在实际成本效益权衡下应如何选择技能,这些问题仍不明确。本文提出**OpenSkillEval**,一个面向技能增强智能体系统及技能本身的自动评估框架。OpenSkillEval 不依赖静态基准,而是从不断演变的现实世界工件中自动构建真实任务实例,涵盖五类下游应用:演示文稿生成、前端网页设计、海报生成、数据可视化和报告生成。它进一步收集并组织社区贡献的技能,以便在统一的任务设置下进行受控比较。利用600多个动态生成的任务实例和30个开源技能,我们对当前最先进的模型和智能体框架进行了系统评估。结果表明:技能的存在并不能保证有效使用;技能增强的收益高度依赖于底层模型和智能体框架;许多公开流行的技能并不总能持续优于无技能的基础智能体。这些发现凸显了动态、任务驱动的评估的必要性,并为LLM智能体技能的设计、选择和部署提供了实用见解。附加案例和基准资源可在项目网站上获取:https://yingjiahao14.github.io/OpenSkillEval-Web/。

## 1 引言

近年来,日益强大的大型语言模型(LLM)[21 (https://arxiv.org/html/2605.23657#bib.bib11),4 (https://arxiv.org/html/2605.23657#bib.bib10)],以及智能体客户端框架的快速发展[2 (https://arxiv.org/html/2605.23657#bib.bib2),19 (https://arxiv.org/html/2605.23657#bib.bib3)],为将模型部署为自主智能体以执行复杂下游任务(包括报告生成、文档管理和网页设计)创造了良好前景。然而,由于智能体任务通常具有开放性,智能体的整体行为难以预测,且在诸多具有挑战性的场景中,智能体仅凭自身能力可能不足以可靠完成任务。为了更好地使模型能够处理此类结构化且复杂的工作流,开发者常将个人经验或积累的最佳实践形式化为显式程序,并将其提炼为供智能体使用的结构化指令。这些面向工作流的格式化指令通常被称为技能[3 (https://arxiv.org/html/2605.23657#bib.bib18)]。

鉴于技能在增强智能体完成下游任务能力方面的潜力,过去几个月里,社区积极参与,创建并集成了大量技能到LLM智能体的生态系统中。然而,这种快速增长也带来了若干重要挑战。首先,不同智能体框架在下游任务上的总体表现,以及它们在执行过程中如何与添加的技能交互,这些问题仍不清楚。缺乏系统评估使得难以衡量其实际有效性。因此,用户可能难以选择合适的智能体用于下游任务。如果智能体缺乏正确执行给定技能的能力,技能增强的实际价值将大打折扣。另一方面,如果智能体本身已足够强大,能够自行解决问题,那么引入技能可能只带来有限的收益,同时还会增加执行成本。其次,单独提炼的技能可能只反映部分或主观经验,这限制了其泛化能力。随着可用技能数量持续增长,如何选择最合适的技能用于提示(prompting)也变得越来越困难,尤其是当用户需要兼顾性能与成本时。此外,重复提交冗余或低质量的技能给社区带来了沉重的维护负担,并导致整个生态系统的膨胀。

为应对这些挑战,我们提出**OpenSkillEval**,一个面向下游应用中技能增强智能体系统及技能本身的自动评估框架。OpenSkillEval 不依赖静态基准,而是动态生成测试用例,持续反映不断变化的用户需求,从而实现更真实、及时且全面的评估环境。基于这些动态构建的任务实例,我们评估了不同模型和智能体框架在有技能增强和无技能增强情况下的有效性和效率,涵盖多种下游任务。此外,通过从开源社区收集针对每个目标应用的技能集,OpenSkillEval 能够在同一任务设置下对不同技能进行受控比较,从而分析其相对质量、鲁棒性和可迁移性。在五大类真实世界应用和超过600个任务中,我们评估了多种最先进的架构,并得出以下重要发现:1)我们发现技能的存在并不能保证智能体有效使用它。在不同的客户端框架下,模型常常未能在任务执行的适当阶段调用技能,并且在许多情况下根本不忠实地遵循所提供的技能指令。这表明,在更复杂、更嘈杂的真实在线环境中,精心设计的技能仍可能被智能体低效利用甚至忽略(第3.1节 (https://arxiv.org/html/2605.23657#S3.SS1));2)我们观察到不同智能体框架在利用技能增强方面存在显著差异。在某些情况下,较弱的基座模型若搭配精心设计的技能和合适的框架,可以达到与较强模型相当的性能。然而,当底层模型本质上难以解决某个任务时,简单地添加技能并不能可靠地带来有意义的提升(第3.2节 (https://arxiv.org/html/2605.23657#S3.SS2));3)我们表明,即使在公开流行的开源技能中,技能质量也存在显著差异。在许多情况下,技能增强的智能体并未优于对应的无技能基础智能体。我们的发现进一步强调,设计不良或对齐不佳的技能不仅无法提供帮助,反而可能增加额外的执行成本。同时,我们的分析提供了关于技能格式和设计的实用启示,如第3.3节 (https://arxiv.org/html/2605.23657#S3.SS3)所述。

## 2 OpenSkillEval 框架

参见图注
图1:OpenSkillEval 框架概述。该框架通过反映不断变化的用户需求,为五个核心任务类别自动生成测试用例。它还从两个互补视角进行自动评估:(1) 分析模型轨迹跟踪,以研究技能在技能增强的智能体系统中如何使用;(2) 评估技能增强下最终产物的质量。

为了有效评估快速增长且日益膨胀的LLM智能体开放技能生态系统,我们将OpenSkillEval设计为一个可持续、可维护的框架,用于真实世界的下游应用任务。因此,我们将系统分解为几个核心组件。第一个组件是自动测试用例生成流水线,它基于真实的用户需求为目标下游任务构建具有代表性的评估实例(第2.1节 (https://arxiv.org/html/2605.23657#S2.SS1))。第二个组件是技能收集与整理流水线,它从开源社区精选技能,并按任务类别组织,以支持对技能发展的持续追踪(第2.2节 (https://arxiv.org/html/2605.23657#S2.SS2))。最后一个组件是评估流水线,系统性地衡量技能在下游场景中的有效性。该评估不仅考虑最终生成产物的质量,还考虑中间智能体轨迹,这为智能体在真实任务环境中是否以及如何恰当地调用和应用技能提供了洞察(第2.3节 (https://arxiv.org/html/2605.23657#S2.SS3))。基于这些组件,OpenSkillEval 能够从两个互补视角——智能体级别比较和技能级别比较——对开放技能生态系统进行高效、动态的审计。图1 (https://arxiv.org/html/2605.23657#S2.F1) 展示了框架的概述。在以下小节中,我们描述每个组件的实现。

### 2.1 自动案例生成

为确保我们评估的实际相关性和可行性,我们聚焦于五类常用的真实世界下游任务:演示文稿生成、前端网页设计、海报生成、数据可视化和报告生成。我们选择这些任务是因为它们代表了常见的真实应用,需要非平凡的多步推理和工具使用,并且通常会产生可直接评估的具体产物。

为了构建反映这些场景中真实用户需求的测试用例,我们采用了一种**工件驱动的案例生成策略**。我们不从头开始手动编写任务指令,而是从现有的高质量工件出发,推断出可能导致其创建的用户底层请求。这种反向构建过程使我们能够构建更贴近实际使用模式和预期输出的评估实例。

具体而言,每个任务类别通过一个三阶段流水线实例化此工件驱动策略。首先,我们从多样化的外部仓库中自动收集工件或源材料 \(S\),作为重建真实用户意图的内容基础。其次,我们执行任务提取,由LLM在预定义模式(schema)下分析收集的材料,构建结构化任务规范 \(T\) 及其对应的自然语言指令 \(I\)。此处,任务规范捕捉了工件或其支持上下文所隐含的底层用户意图、约束和预期输出。第三,我们应用验证程序,确保提取的任务规范内部一致且与源内容兼容,从而保证生成的任务实例既连贯又真实。下面,我们描述每个任务类别的来源选择和提取过程。

**演示文稿生成。** 对于演示文稿(以下简称PPT)生成,我们收集公开可用、更新及时且信息密集的网页和文档,例如基准排行榜、行业报告、开放数据门户和学术论文,这些内容自然适合幻灯片摘要和重组。每个来源被爬取、快照保存,然后通过基于LLM的流水线处理,生成幻灯片级别的任务规范,明确每张幻灯片的内容目标,从而形成基于真实世界的演示文稿生成请求。

**前端网页设计。** 对于网页设计,我们直接使用现有网站作为目标工件。具体而言,我们从设计奖项平台(如 Awwwards (https://www.awwwards.com/))和产品发现网站(如 SaaS Landing Page (https://saaslandingpage.com/))自动精选公开可访问的高质量网站,并按网站类型和行业领域两个维度进行组织。对于每个网站,我们捕获其渲染布局、导航结构和交互组件,然后使用基于LLM的逆向工程将这些观察结果转换为相应任务实例的结构化设计规范。

**海报生成。** 为了涵盖多种常见的真实世界场景,我们自动收集与实际海报创建需求相关的源内容,例如数据报告可视化、产品推广、活动广告和社会倡导。收集的材料涵盖多个领域,包括技术、健康、环境和商业,并根据这些海报使用场景进行组织。然后,我们使用LLM将每个源转换为海报任务规范,定义目标受众、核心信息和要呈现的关键内容块。

**数据可视化。** 与前几类任务不同,数据可视化不直接从现有工件作为任务输入开始。相反,我们首先调研来自开放数据门户(如 Our World in Data (https://ourworldindata.org/))和科学出版物的高质量可视化示例,以推导出可视化类型、主题领域和分析目标的分类法。基于此分类法,我们采样任务配置,并提示LLM将它们实例化为具体的任务规范。对于每个生成的规范,我们进一步生成一个匹配的数据表,该表与目标可视化和分析目标一致,从而实现可视化生成的端到端评估。

**报告生成。** 对于报告生成,我们在来自开放数据平台(如 Kaggle (https://www.kaggle.com/datasets))的公开可用、真实世界表格数据集基础上构建任务,涵盖电子商务、金融、医疗、教育和技术等多个领域。基于这些基础数据源,我们使用LLM沿着几个关键维度构建报告生成任务规范,包括报告类型、所需章节和分析维度。每个任务规范通过将请求的分析和报告组件链接到具体数据列,明确地基于底层数据集。对于生成的每个实例,我们保留三个组件:源包 \(S\)(包含 `source_brief.md` 以及相关数据文件,如适用)、结构化任务规范 \(T\)(`task_input.json`)和自然语言指令 \(I\)(`instruction.md`)。由于这些下游任务没有单一的标准答案,我们的验证过程不依赖参考输出。相反,在第三阶段,我们使用验证器LLM评估 \(T\) 和 \(I\) 是否信息完整且充分基于源包 \(S\),并过滤掉不一致、未充分指定或源内容支持薄弱的实例。由于整个流水线是自动化的,基准测试可以随着底层内容源的演变而持续刷新,从而更好地跟上不断变化的真实用户需求。在当前版本中,我们使用 Claude-4.6-Opus 和 GPT-5.2 作为流水线中的主要生成器,总共产生了 677 个任务实例。这些实例在各任务类别中的分布如图2.1 (https://arxiv.org/html/2605.23657#S2.SS1) 所示,任务模式及附加案例研究见附录A.3 (https://arxiv.org/html/2605.23657#A1.SS3)。

参见图注

相似文章

OpenSkill:LLM智能体的开放世界自进化

Hugging Face Daily Papers

OpenSkill是一个框架,让LLM智能体能够从开放世界资源中自进化技能和验证信号,无需目标任务监督,在多个基准测试中实现高性能。

SkillRet:面向 LLM 智能体技能检索的大规模基准

arXiv cs.AI

本文提出了 SkillRet,这是一个用于评估 LLM 智能体技能检索的大规模基准,旨在解决从大型技能库中选择相关技能的挑战。该基准提供了包含超过 17,000 项技能的 dataset,并证明针对特定任务的微调能显著提升检索性能。