我在 38 个部署中达到了 1,000 多个遥测事件——现在我应该考虑什么?

Reddit r/AI_Agents 工具

摘要

一位开源 AI 工作流自动化平台的独立开发者讨论了扩展到 1,000 多个遥测事件,并寻求社区关于维护、向后兼容性和可观测性的建议,以应对增长的使用量。

我一直在构建一个开源的 AI 工作流自动化平台,主要作为独立项目进行了一段时间。我最近检查了遥测仪表板,诚实地感到惊讶,看到在 38 个独特的平台部署中有 1,062 个遥测事件。该项目已经从一个相对较小的工作流运行器发展成具有工作流、分支、工具、代理记忆、文档 RAG、调度、webhooks 和可视化工作流构建器的东西。我现在到了一个阶段,开始少想‘下一个功能应该构建什么?’,而更多地考虑‘随着更多人实际使用,如何避免破坏东西?’对于那些维护过开始获得真实使用量的开源项目的人:你希望你早些时候就设置了什么?比如:当你在更改工作流格式时,如何处理向后兼容性?你什么时候开始认真担心迁移?如何安全地推出更新而不破坏现有安装?什么样的遥测/可观测性是有用的?如何处理来自你无法复现的环境的错误报告?当你的项目从‘几个人尝试’到实际部署时,你是否犯过任何错误?我特别感兴趣的是维护自托管/开源基础设施的人的经验教训,因为用户控制着他们自己的安装,我不能简单地向每个人推送更新。真的很感激听到你通过艰难方式学到的东西。
查看原文

相似文章

你用什么进行可观测性?

Reddit r/LocalLLaMA

一位开发者讨论了AI代理缺乏合适的可观测性工具,对现有解决方案如Opik表示失望,并希望有一个支持OpenTelemetry的服务,用于分析代理会话和故障模式。