你尝试过任何与Claude管理智能体相似但成本更低的开源框架吗?

Reddit r/AI_Agents 工具

摘要

文章比较了Claude管理智能体与TrueForge等开源替代方案,发现开源工具可以在成本更低和令牌使用更少的情况下实现相似的任务解决率。

Claude管理智能体是一个非常好的产品,其功能深度在开源领域难以匹配。但我想了解选择开源实际上会放弃什么。不仅仅是在功能清单上,而是在实际的智能体工作负载中:相同的模型、相同的提示、相同的任务。因此,我尝试通过运行14个跨系统任务来验证这一点,背后有三个MCP服务器——一个CRM、一个问题跟踪器和一个文档存储,通过管理智能体、deepagents和TrueForge,后两者都是开源智能体框架。 最令人惊讶的结果是:Claude管理智能体 + Opus 4.8:11/14任务解决 | 每次运行$11.8 | 每次运行10.0M令牌 TrueForge + Opus 4.8:11/14任务解决 | 每次运行$8.6 | 每次运行3.7M令牌 相同的模型。相同的基准测试。相同的平均解决率。但TrueForge使用的令牌减少了约63%,每次运行成本降低了约30%。 我们在工具使用上也看到了类似的差异:TrueForge平均每任务19次工具调用,而Claude管理智能体为32次。 然后我尝试更换模型。TrueForge + GLM-5.2:11.7/14解决 | 每次运行$3.0 | 每次运行3.8M令牌 在这个基准测试中,这比Claude管理智能体 + Opus的平均解决率略高,而成本大约低75%。 这仍然是早期阶段。开源运行时尚未具备一流的跟踪/评估工具。它们不自带代码执行沙箱,因此你需要接入一个。上下文压缩是有意有损的。因此,它绝对不是成熟管理智能体平台的完整功能替代品,但我认为有趣的是,核心运行时在保持开源、模型中立和可部署在自己的基础设施上的同时,已经能够在这些任务上具有竞争力。 我已经将仓库放在评论中。
查看原文

相似文章