@rohanpaul_ai: 一个公共的GitHub仓库现在保存了380万个代理技能文件。并且发现超过一半的代理技能文件在公共GitHub上…

X AI KOLs Following 论文

摘要

一篇论文分析了来自公共GitHub仓库的380万个代理技能文件的数据集,揭示超过一半是完全相同的副本,并提供了一个SQLite文件供进一步研究。

一个公共的GitHub仓库现在保存了380万个代理技能文件。 并且发现超过一半的代理技能文件在公共GitHub上是另一个文件的完全相同的副本。 在380万个文件中,只有大约190万个是真正不同的。 这就是没有注册表和包管理器的格式是什么样子。 人们复制文件夹然后继续前进。技能是一个包含Markdown文件的文件夹,告诉代理如何处理任务。 代理在运行时读取简短描述,并自行决定是否加载它。没有编译器检查这个决定。 因此,您仓库中的技能是固定的,编写它的人无法向您发送修复。 论文提出了显而易见的下一个问题:编辑过的流行技能副本是否添加了原始技能从未有的命令或网络调用。 以前没有人能在这个规模上检查这一点。 整个数据集作为一个SQLite文件发布,所以现在有人可以做到了。 – arxiv. org/abs/2608.10906 标题:"GitSkills:GitHub上的代理技能数据集"
查看原文
查看缓存全文

缓存时间: 2026/08/24 01:46

目前有一个公开的GitHub仓库已收录380万份智能体技能文件。

研究发现,公开GitHub上超过半数的智能体技能文件存在完全复制现象。

在380万文件中,实际独立内容仅约190万份。

这正是缺乏统一注册中心与包管理器的现状体现。

人们往往直接复制文件夹继续使用。每个技能本质上是一个包含Markdown文件的文件夹,用于指导智能体处理特定任务。

智能体在运行时读取简短描述,并自主决定是否加载该技能,此过程不受编译器校验。

因此你仓库中的技能文件可能已固化,原作者无法及时推送修复方案。

该研究提出了一个关键问题:对流行技能的修改版本是否添加了原版未包含的指令或网络请求。

此前从未有过如此规模的检测条件。

完整数据集以SQLite单文件形式发布,现终于可以实现规模化分析。

– arxiv.org/abs/2608.10906

《GitSkills:GitHub智能体技能数据集》

相似文章