我信任评分了171个开源AI智能体——大多数无法证明其供应链
摘要
一位开发者创建了171个开源AI智能体的独立信任注册表,根据可验证的信任信号(如供应链安全和维护)进行评分,发现只有三个智能体获得A级评级,而许多流行智能体缺乏基本验证。
我一直在构建一个开源AI智能体的独立信任注册表,结果令人大开眼界。简而言之:我追踪了14个类别(编码智能体、框架、浏览器智能体、记忆系统等)的171个智能体,并根据可验证的信任信号(而非星级或炒作)进行评分。这些信号包括OSSF Scorecard、构建来源证明(SLSA)、签名提交、许可证透明度和维护模式。
**让我惊讶的是:**
* 171个智能体中,只有3个拥有足够的独立信号覆盖,获得了A级评级(在多个维度上有广泛的可验证证据)
* 一些获得最多星标的智能体在信任方面得分很低,因为它们完全没有供应链验证——没有评分卡、没有来源证明、没有签名提交
* 那个拥有16.6万GitHub星标的智能体在信任度上排名第108位(部分是数据错误,我已修复;部分是真实情况:流行度≠可验证性)
* 那些确实发布来源证明并通过OSSF检查的智能体,星标数往往处于中游,但在信任度上排名靠前
**评分原理:**
评分公式根据信号伪造难度加权:
* 安全/完整性(30分):OSSF Scorecard、构建来源证明、签名提交
* 身份(20分):已验证列表 + 来源证明绑定
* 透明度(20分):许可证 + OSSF透明度检查
* 维护(20分):提交新鲜度 + 活跃度
* 采用率(10分):对数缩放、封顶星标数 + 下载量
然后原始分数乘以置信因子(我们实际拥有的信号类型数量)——因此,即使一个智能体很流行,如果无法验证其大量信号,也无法达到最高等级。
**为什么我要构建这个:**
随着MCP和A2A的兴起,智能体即将开始相互调用。目前没有标准化的方式来回答“智能体A应该信任智能体B吗?”问题。我正努力朝这个方向努力——信任数据是开放的(CC BY 4.0)、机器可读的,还有一个带有雷达图的比较工具,如果你想了解特定智能体的对比情况。欢迎对方法论或你认为缺失的智能体提供反馈。完整排行榜在hvtracker,方法论已发布。
相似文章
如果 AI 代理无处不在,我们如何知道哪些值得信任?
随着 AI 代理变得无处不在,挑战从比较性能转向建立信任和声誉,需要新的发现和验证系统。
为代理经济降低风险
x402 Trust 持续监控超过 85,000 个端点并提供风险评分,防止AI代理在支付中受骗,同时通过语义搜索识别可信服务。
MIT的研究人员记录了各大实验室正在部署的30个AI智能体。其中只有4个有公开文档说明该智能体的功能、不能做什么以及发生故障时的处理方式。
MIT研究人员编制了2025年AI Agent Index,记录了来自主要实验室的30个已部署的AI智能体,然而只有4个提供了公开文档,解释智能体的功能、局限性及故障模式,揭示了重大的透明度缺口。
构建了一个开源工具,用于检测 AI 智能体系统中缺失的验证、重试和错误处理
我们发布了 Trustabl Agent Analyzer,一款开源工具,可扫描 AI 智能体仓库,检测缺失的验证、重试和错误处理,并生成保护隐私的本地报告。
我构建了一个实时排名系统,涵盖所有AI代理和基础模型(开源)
一位开发者推出了AgentTape,这是一个实时排名网站,汇聚来自多个来源(GitHub、Hugging Face、OpenRouter等)的数据,对公开的AI代理和基础模型进行评分和比较,旨在提供超越基准测试的更全面评估。