我构建了一个实时排名系统,涵盖所有AI代理和基础模型(开源)
摘要
一位开发者推出了AgentTape,这是一个实时排名网站,汇聚来自多个来源(GitHub、Hugging Face、OpenRouter等)的数据,对公开的AI代理和基础模型进行评分和比较,旨在提供超越基准测试的更全面评估。
我构建了[AgentTape](https://agenttape.com/),因为现有的模型排行榜无法完全涵盖我感兴趣的所有方面:基准测试性能只是一部分,还有谁在真正使用某个模型、谁在讨论它,以及它在成本和速度上的对比情况。它每小时从GitHub、Hugging Face、OpenRouter、MCP注册中心、npm、PyPI、arXiv、Hacker News等来源拉取数据,对每个公开的AI代理和基础模型进行评分和比较。我仍在调整评分方法,所以我很想听听你的想法——无论这个工具是否有用,或者你认为我有什么地方做得不对!
相似文章
构建了一个广播仪表盘,监测来自21个主要来源的AI代理发展动态——这是我正在追踪的内容以及缺失的部分
一位用户描述构建了一个广播仪表盘,追踪来自arXiv、GitHub和Hugging Face等21个来源的AI代理发展动态,指出了覆盖的强项和不足。
开放智能体排行榜
IBM Research 发布了开放智能体排行榜,这是一个开放的基准测试和评估框架,用于基于质量和成本比较完整的 AI 智能体系统,旨在衡量跨多样化任务的通用性。
我不再根据GitHub总星数来排名AI代理工具,而是开始追踪星速。本周排名第一的是一项仅诞生1天的Codex "模型路由"技能。
一位开发者分享了一种新的方法,通过GitHub星速而非总星数来排名AI代理工具,重点介绍了codex-model-routing、pilotfish和motion-anything等热门项目。该方法将GitHub与MCP注册表进行交叉验证,以过滤掉虚假星标。
@rohanpaul_ai:Arena 刚刚发布了一个真实世界的智能体排行榜,该排行榜根据人工智能模型完成实际用户任务的效果进行排名,而不仅仅是……
Agent Arena 是一个新的排行榜,它通过任务成功、可操控性和恢复等信号评估人工智能模型在编码、研究、文件分析等真实世界智能体任务上的表现,其中 GPT-5.5 High 领先。
@UnTalNixon_exe: AI代理的权威地图:35种代理架构及对比基准 构建AI代理不仅仅是……
本文介绍了一个仓库,该仓库系统性地收集并基准测试了35种AI代理架构,帮助开发者选择生产系统中有效的控制结构。