标签
关于理解AI代理之间交互的挑战的评论,其中单个行为可见,但集体行为不透明,直到故障到达客户那里。
Arize Phoenix 宣布为其AI代理监控平台新增定制功能,包括可定制图表、命令K、最近搜索以及自定义列排序。
一个开源的Docker Compose配置,集成了多个开源工具(LiteLLM、LLM Guard、OpenBao、Langfuse等),为组织提供受治理、合规、可审计的AI平台,并附带用户友好的界面用于构建受治理的工作流。
作者讨论了构建六个AI智能体工具框架的过程,并强调需要一个专用数据库来追踪智能体的执行、状态和学习成果,而不仅仅是依赖可观测性工具。
Plano是一个开源代理,位于AI agent和LLM提供商之间,通过智能路由、护栏过滤和成本感知选择来降低成本,所有配置通过单个YAML文件完成,无需修改agent代码。
Phoenix 现在包含可定制的实验图表和基准化功能,允许用户沿性能、延迟、令牌和成本维度比较模型,并为偏好模型设定基准。
Phoenix 内置了 Pixie 智能助手,能帮助用户快速筛选出智能体 span 出错但模型回复正常的静默失败 trace,大幅提升 trace 阅读效率。
本文比较了在四个层面上用于智能体可靠性的热门开发者工具:追踪/评估、运行时护栏和网关。结果表明,没有一款开源工具能覆盖所有层面,大多数开发者会组合使用多种工具。
AI智能体生态系统中有许多用于构建智能体的框架,但缺乏用于部署和治理的运营层,这引发了对是否需要智能体控制平面的讨论。
LangSmith 聚焦 Finch Legal,一家利用 AI 代理处理人身伤害诉讼诉前阶段的初创公司,实现了 10 倍增长,并使用 LangSmith 进行生产可观测。
讨论生产环境代理评估应包括故障重放和恢复能力,而不仅仅是顺利路径的任务成功,强调需要可观测性以实现恢复。
本文提出了一种基于可控性-可观测性的框架,通过减少隐藏状态冗余来压缩深度神经网络,在MNIST和CIFAR-10数据集上实现了显著压缩,且精度损失极小。
施耐德电气使用 LangChain 的 LangSmith 在100多个国家运行超过60个生产级AI代理,通过其AI助手为16万名员工提供服务,展示了企业级LLMOps能力。
基于数月研究,针对250人公司部署的LLM评估与可观测性平台详细对比,涵盖全栈平台、可观测性工具和开源框架。
Arize Phoenix宣布新增追踪搜索功能,以处理日益长且复杂的代理追踪,允许用户跨追踪进行搜索,并查看span的调用堆栈。
一项统计显示,在生产中,89%的代理团队拥有可观测性,但只有52%运行评估,这引发了关于如何控制提示变更的问题。
一位开发者认为,大多数生产环境下的AI代理缺乏必要的可观测性,例如会话追踪和成本监控,并将其比作在没有监控的情况下部署Web应用。文章质疑代理可观测性是否仍是一个未解决的问题。
Eve 是一个用于构建持久、生产就绪的 AI 智能体的框架,具有内置的可观测性、内省和自我改进能力,旨在与 Next.js 和 Vercel 部署无缝协作。
TraceSage 是一款采用MIT许可的新兴本地优先可观测性工具,专为LangChain和LangGraph设计,完全在您的机器上运行,提供实时拓扑图、逐步重放、令牌追踪和OpenTelemetry导出功能,无需将数据发送至云端。
GreptimeDB v1.1.2 是一个补丁版本,修复了定时 Flows 中 now() 的绑定问题,以确保 EVAL INTERVAL 窗口的确定性。此外还修复了以下问题:Kafka SASL 密码在调试输出中的屏蔽、GC 索引文件列表、parquet 元数据缓存大小、Prometheus 标签发现扫描以及 PromQL 时间二元聚合。建议用户升级。