这是我们的 Agent Run Dashboard
摘要
这篇文章描述了一个内部的 Agent Run Dashboard,用于跟踪 AI 智能体的运行情况、质量评分和工作流性能,提供对人机协作的可见性,并表明这种方法可以应用于软件开发之外。
我们在项目中大量使用智能体,并构建了我们所认为的软件工厂:标准化工作流,让智能体承担可重复的开发任务,同时我们的团队保持对方向、审查和质量的把控。截图(在第一条评论中)展示了该设置的一部分:我们的 Agent Run Dashboard。实际的运行摘要因包含客户工作而被隐藏,但仪表盘让我们可以跨项目和技术进行高层级查看:
• 每天智能体运行次数
• 人工质量评分
• 基于 LLM 的质量评分
• 最常用的智能体工作流
• 工作流性能随时间变化的趋势
这为我们提供了我认为正变得越来越重要的东西:对人与智能体实际协作方式的可见性。我们可以看到哪些工作流创造了价值,哪些环节质量出色,哪些地方需要改进,以及智能体使用情况如何在我们的组织中演变。有趣的是,这个概念并不局限于软件开发。同样的方法可以应用于许多业务流程:标准化智能体工作流、可衡量的结果、人工反馈,以及一个展示整个组织动态的仪表盘。在我们看来,这就是成为一个智能体驱动型组织的样子。以结构化和可衡量的方式设计可重复的工作流,让人类和智能体协同工作。你们怎么看?
相似文章
@9hills: 多租户智能仪表板,针对小型企业和小型团队内部共享智能体平台以创建…
一个多租户仪表板,供小型企业和团队共享和管理AI智能体平台,支持单点登录、Docker部署以及与各种后端的集成。
在生产环境中,你们如何跟踪AI智能体的实际行为?
本文重点介绍了团队在监控生产环境中AI智能体时面临的挑战,尤其涉及合规性和健康状况,并邀请探讨当前实践与不足之处。
@hanakoxbt: https://x.com/hanakoxbt/status/2091515787366306154
文章解释了如何利用循环进行自动化检查,以及通过图表优化工作流,从而减少在管理AI代理时的人工监督。
因为失控的 agent 浪费几百美元 API 额度,基本上已经成为一种入门仪式了。这是我的经历。
我现在开始觉得这是一种共同经历了。我认识的所有构建 agentic AI 的人,git 历史深处都藏着同样的悄悄话:那个让 agent 无人看管跑了一整个周末的经历、周一收到的账单、试图弄清楚它到底做了什么的取证工作。我的经历是两天内花了 400 多美元。我的 agent 对着同一个研究任务换着法子自言自语了 48 小时,结果什么都没产出。感觉就像被一个非常有礼貌的 Phi
智能体工作流可视化工具:反馈与修正
介绍了一款用于可视化AI智能体工作流的工具,支持多种智能体框架,包括Langgraph、CrewAI、AutoGen、Google ADK和OpenAI Agents SDK。创作者正在寻求社区的反馈与修正。