我信任评分了171个开源AI智能体——大多数无法证明其供应链

Reddit r/AI_Agents 工具

摘要

一位开发者创建了171个开源AI智能体的独立信任注册表,根据可验证的信任信号(如供应链安全和维护)进行评分,发现只有三个智能体获得A级评级,而许多流行智能体缺乏基本验证。

我一直在构建一个开源AI智能体的独立信任注册表,结果令人大开眼界。简而言之:我追踪了14个类别(编码智能体、框架、浏览器智能体、记忆系统等)的171个智能体,并根据可验证的信任信号(而非星级或炒作)进行评分。这些信号包括OSSF Scorecard、构建来源证明(SLSA)、签名提交、许可证透明度和维护模式。 **让我惊讶的是:** * 171个智能体中,只有3个拥有足够的独立信号覆盖,获得了A级评级(在多个维度上有广泛的可验证证据) * 一些获得最多星标的智能体在信任方面得分很低,因为它们完全没有供应链验证——没有评分卡、没有来源证明、没有签名提交 * 那个拥有16.6万GitHub星标的智能体在信任度上排名第108位(部分是数据错误,我已修复;部分是真实情况:流行度≠可验证性) * 那些确实发布来源证明并通过OSSF检查的智能体,星标数往往处于中游,但在信任度上排名靠前 **评分原理:** 评分公式根据信号伪造难度加权: * 安全/完整性(30分):OSSF Scorecard、构建来源证明、签名提交 * 身份(20分):已验证列表 + 来源证明绑定 * 透明度(20分):许可证 + OSSF透明度检查 * 维护(20分):提交新鲜度 + 活跃度 * 采用率(10分):对数缩放、封顶星标数 + 下载量 然后原始分数乘以置信因子(我们实际拥有的信号类型数量)——因此,即使一个智能体很流行,如果无法验证其大量信号,也无法达到最高等级。 **为什么我要构建这个:** 随着MCP和A2A的兴起,智能体即将开始相互调用。目前没有标准化的方式来回答“智能体A应该信任智能体B吗?”问题。我正努力朝这个方向努力——信任数据是开放的(CC BY 4.0)、机器可读的,还有一个带有雷达图的比较工具,如果你想了解特定智能体的对比情况。欢迎对方法论或你认为缺失的智能体提供反馈。完整排行榜在hvtracker,方法论已发布。
查看原文

相似文章

为代理经济降低风险

Reddit r/AI_Agents

x402 Trust 持续监控超过 85,000 个端点并提供风险评分,防止AI代理在支付中受骗,同时通过语义搜索识别可信服务。