@dair_ai: 终于,有一篇好论文测试了 Agent Skills 是否真的有帮助。如果你正在维护技能库,值得一读 …

X AI KOLs Following 论文

摘要

一项基准研究表明,在 Web 开发任务中注入 Agent Skills 通常会降低性能并增加令牌成本,存在长度分散和内容误导等失败模式,凸显了按部署评估的必要性。

终于,有一篇好论文测试了 Agent Skills 是否真的有帮助。 如果你在团队中维护技能库,值得一读。 WebDev-Skills-Bench 在 50 个 Web-Bench 项目和 1,000 个有序任务上运行 31 个公共 WebDev Skills,并使用长度匹配的无关控制,以便将提示长度效应与 Skill 内容分离开来。 注入目标 Skill 会使平均 Pass@2 下降 1.3% 到 4.2%,降低任务完成深度,并将令牌成本提高 72% 到 394%。在 17% 到 36% 的 Skill-项目对中出现增益。 控制将损害分为两种失败模式。一些模型是长度分散的,其中同样长度的无关 Skill 重现了大部分损失。另一些是内容误导的,其中提示长度是中性的,而 Skill 内容仍然造成 1.1 到 1.4 分的损失。 其他发现: > 损失集中在简单的早期任务上 > Skill 排名在不同模型之间转移较弱 > 反模式规则优于 Skills 中有帮助的示例密集内容 论文:https://arxiv.org/abs/2608.23067 在我们的学院中追踪更多热门 AI 论文:https://academy.dair.ai
查看原文
查看缓存全文

缓存时间: 2026/08/26 11:17

创建博客

相似文章