这是我们的 Agent Run Dashboard

Reddit r/AI_Agents 工具

摘要

这篇文章描述了一个内部的 Agent Run Dashboard,用于跟踪 AI 智能体的运行情况、质量评分和工作流性能,提供对人机协作的可见性,并表明这种方法可以应用于软件开发之外。

我们在项目中大量使用智能体,并构建了我们所认为的软件工厂:标准化工作流,让智能体承担可重复的开发任务,同时我们的团队保持对方向、审查和质量的把控。截图(在第一条评论中)展示了该设置的一部分:我们的 Agent Run Dashboard。实际的运行摘要因包含客户工作而被隐藏,但仪表盘让我们可以跨项目和技术进行高层级查看: • 每天智能体运行次数 • 人工质量评分 • 基于 LLM 的质量评分 • 最常用的智能体工作流 • 工作流性能随时间变化的趋势 这为我们提供了我认为正变得越来越重要的东西:对人与智能体实际协作方式的可见性。我们可以看到哪些工作流创造了价值,哪些环节质量出色,哪些地方需要改进,以及智能体使用情况如何在我们的组织中演变。有趣的是,这个概念并不局限于软件开发。同样的方法可以应用于许多业务流程:标准化智能体工作流、可衡量的结果、人工反馈,以及一个展示整个组织动态的仪表盘。在我们看来,这就是成为一个智能体驱动型组织的样子。以结构化和可衡量的方式设计可重复的工作流,让人类和智能体协同工作。你们怎么看?
查看原文

相似文章

因为失控的 agent 浪费几百美元 API 额度,基本上已经成为一种入门仪式了。这是我的经历。

Reddit r/artificial

我现在开始觉得这是一种共同经历了。我认识的所有构建 agentic AI 的人,git 历史深处都藏着同样的悄悄话:那个让 agent 无人看管跑了一整个周末的经历、周一收到的账单、试图弄清楚它到底做了什么的取证工作。我的经历是两天内花了 400 多美元。我的 agent 对着同一个研究任务换着法子自言自语了 48 小时,结果什么都没产出。感觉就像被一个非常有礼貌的 Phi

智能体工作流可视化工具:反馈与修正

Reddit r/AI_Agents

介绍了一款用于可视化AI智能体工作流的工具,支持多种智能体框架,包括Langgraph、CrewAI、AutoGen、Google ADK和OpenAI Agents SDK。创作者正在寻求社区的反馈与修正。

AI仪表盘 + 基础设施 + Rocket.Chat

Reddit r/AI_Agents

作者分享了他们使用Rocket.Chat、CLI代理和tmux构建AI代理基础设施的经验,规模扩展至250个客户,帮助他们建立网站。他们从销售服务转向教客户自己使用代理,强调了此类系统中上下文管理的重要性。

有了 GraphARC,AI 代理从未如此可解释!

Reddit r/AI_Agents

GraphArc 是一个开源工具,可将 AI 代理工作流可视化为交互式实时图形,使用户能够在执行前检查、调试和批准代理操作,从而让代理式 AI 更具可解释性和可控性。