这是我们的 Agent Run Dashboard
摘要
这篇文章描述了一个内部的 Agent Run Dashboard,用于跟踪 AI 智能体的运行情况、质量评分和工作流性能,提供对人机协作的可见性,并表明这种方法可以应用于软件开发之外。
我们在项目中大量使用智能体,并构建了我们所认为的软件工厂:标准化工作流,让智能体承担可重复的开发任务,同时我们的团队保持对方向、审查和质量的把控。截图(在第一条评论中)展示了该设置的一部分:我们的 Agent Run Dashboard。实际的运行摘要因包含客户工作而被隐藏,但仪表盘让我们可以跨项目和技术进行高层级查看:
• 每天智能体运行次数
• 人工质量评分
• 基于 LLM 的质量评分
• 最常用的智能体工作流
• 工作流性能随时间变化的趋势
这为我们提供了我认为正变得越来越重要的东西:对人与智能体实际协作方式的可见性。我们可以看到哪些工作流创造了价值,哪些环节质量出色,哪些地方需要改进,以及智能体使用情况如何在我们的组织中演变。有趣的是,这个概念并不局限于软件开发。同样的方法可以应用于许多业务流程:标准化智能体工作流、可衡量的结果、人工反馈,以及一个展示整个组织动态的仪表盘。在我们看来,这就是成为一个智能体驱动型组织的样子。以结构化和可衡量的方式设计可重复的工作流,让人类和智能体协同工作。你们怎么看?
相似文章
因为失控的 agent 浪费几百美元 API 额度,基本上已经成为一种入门仪式了。这是我的经历。
我现在开始觉得这是一种共同经历了。我认识的所有构建 agentic AI 的人,git 历史深处都藏着同样的悄悄话:那个让 agent 无人看管跑了一整个周末的经历、周一收到的账单、试图弄清楚它到底做了什么的取证工作。我的经历是两天内花了 400 多美元。我的 agent 对着同一个研究任务换着法子自言自语了 48 小时,结果什么都没产出。感觉就像被一个非常有礼貌的 Phi
智能体工作流可视化工具:反馈与修正
介绍了一款用于可视化AI智能体工作流的工具,支持多种智能体框架,包括Langgraph、CrewAI、AutoGen、Google ADK和OpenAI Agents SDK。创作者正在寻求社区的反馈与修正。
构建了一个广播仪表盘,监测来自21个主要来源的AI代理发展动态——这是我正在追踪的内容以及缺失的部分
一位用户描述构建了一个广播仪表盘,追踪来自arXiv、GitHub和Hugging Face等21个来源的AI代理发展动态,指出了覆盖的强项和不足。
AI仪表盘 + 基础设施 + Rocket.Chat
作者分享了他们使用Rocket.Chat、CLI代理和tmux构建AI代理基础设施的经验,规模扩展至250个客户,帮助他们建立网站。他们从销售服务转向教客户自己使用代理,强调了此类系统中上下文管理的重要性。
有了 GraphARC,AI 代理从未如此可解释!
GraphArc 是一个开源工具,可将 AI 代理工作流可视化为交互式实时图形,使用户能够在执行前检查、调试和批准代理操作,从而让代理式 AI 更具可解释性和可控性。