@dair_ai: 终于,有一篇好论文测试了 Agent Skills 是否真的有帮助。如果你正在维护技能库,值得一读 …
摘要
一项基准研究表明,在 Web 开发任务中注入 Agent Skills 通常会降低性能并增加令牌成本,存在长度分散和内容误导等失败模式,凸显了按部署评估的必要性。
终于,有一篇好论文测试了 Agent Skills 是否真的有帮助。
如果你在团队中维护技能库,值得一读。
WebDev-Skills-Bench 在 50 个 Web-Bench 项目和 1,000 个有序任务上运行 31 个公共 WebDev Skills,并使用长度匹配的无关控制,以便将提示长度效应与 Skill 内容分离开来。
注入目标 Skill 会使平均 Pass@2 下降 1.3% 到 4.2%,降低任务完成深度,并将令牌成本提高 72% 到 394%。在 17% 到 36% 的 Skill-项目对中出现增益。
控制将损害分为两种失败模式。一些模型是长度分散的,其中同样长度的无关 Skill 重现了大部分损失。另一些是内容误导的,其中提示长度是中性的,而 Skill 内容仍然造成 1.1 到 1.4 分的损失。
其他发现:
> 损失集中在简单的早期任务上
> Skill 排名在不同模型之间转移较弱
> 反模式规则优于 Skills 中有帮助的示例密集内容
论文:https://arxiv.org/abs/2608.23067
在我们的学院中追踪更多热门 AI 论文:https://academy.dair.ai
查看缓存全文
缓存时间: 2026/08/26 11:17
创建博客
相似文章
@dair_ai: 一篇揭示代理技能的优秀论文。
这篇论文通过分析8,135次标准化试验,揭示了代理技能的本质,挑战了技能主要向模型注入知识的假设。
@dair_ai: 如果你在构建 Web 代理,这篇关于如何让代理技能可复用的文章值得你花时间阅读。(收藏它)LLM web…
本文介绍了 SkillMigrator,一个 LLM Web 代理,它通过匹配布局结构而非领域特定元数据来学习可复用技能并在网站间迁移这些技能,在 WebArena 和 Mind2Web 基准测试中将 LLM 操作次数减少了 8-10%。
如何评估技能以构建更好的智能体工具
一篇文章讨论评估技能的方法,以构建更好的智能体工具,可能侧重于AI智能体开发的实用方法。
@xdotli: 使用AI基准测试的一大痛点就是在其首次发布后遇到错误。今天,我们发布了SkillsBe…
SkillsBench 1.1已发布,作为首个经过审计、无错误的AI智能体技能基准测试,显示能力从约36%迅速提升至67%的解决率,并证明技能可以替代模型规模。
从原始经验到技能消费:模型生成智能体技能的系统研究
本文系统评估了语言智能体的模型生成技能,涵盖经验生成、提取和消耗的完整生命周期,发现技能平均有益但存在显著的负迁移,从而引出一种提高技能质量的元技能。