标签
作者讨论了构建六个AI智能体工具框架的过程,并强调需要一个专用数据库来追踪智能体的执行、状态和学习成果,而不仅仅是依赖可观测性工具。
Plano是一个开源代理,位于AI agent和LLM提供商之间,通过智能路由、护栏过滤和成本感知选择来降低成本,所有配置通过单个YAML文件完成,无需修改agent代码。
Phoenix 现在包含可定制的实验图表和基准化功能,允许用户沿性能、延迟、令牌和成本维度比较模型,并为偏好模型设定基准。
Phoenix 内置了 Pixie 智能助手,能帮助用户快速筛选出智能体 span 出错但模型回复正常的静默失败 trace,大幅提升 trace 阅读效率。
本文比较了在四个层面上用于智能体可靠性的热门开发者工具:追踪/评估、运行时护栏和网关。结果表明,没有一款开源工具能覆盖所有层面,大多数开发者会组合使用多种工具。
AI智能体生态系统中有许多用于构建智能体的框架,但缺乏用于部署和治理的运营层,这引发了对是否需要智能体控制平面的讨论。
LangSmith 聚焦 Finch Legal,一家利用 AI 代理处理人身伤害诉讼诉前阶段的初创公司,实现了 10 倍增长,并使用 LangSmith 进行生产可观测。
讨论生产环境代理评估应包括故障重放和恢复能力,而不仅仅是顺利路径的任务成功,强调需要可观测性以实现恢复。
本文提出了一种基于可控性-可观测性的框架,通过减少隐藏状态冗余来压缩深度神经网络,在MNIST和CIFAR-10数据集上实现了显著压缩,且精度损失极小。
施耐德电气使用 LangChain 的 LangSmith 在100多个国家运行超过60个生产级AI代理,通过其AI助手为16万名员工提供服务,展示了企业级LLMOps能力。
基于数月研究,针对250人公司部署的LLM评估与可观测性平台详细对比,涵盖全栈平台、可观测性工具和开源框架。
Arize Phoenix宣布新增追踪搜索功能,以处理日益长且复杂的代理追踪,允许用户跨追踪进行搜索,并查看span的调用堆栈。
一项统计显示,在生产中,89%的代理团队拥有可观测性,但只有52%运行评估,这引发了关于如何控制提示变更的问题。
一位开发者认为,大多数生产环境下的AI代理缺乏必要的可观测性,例如会话追踪和成本监控,并将其比作在没有监控的情况下部署Web应用。文章质疑代理可观测性是否仍是一个未解决的问题。
Eve 是一个用于构建持久、生产就绪的 AI 智能体的框架,具有内置的可观测性、内省和自我改进能力,旨在与 Next.js 和 Vercel 部署无缝协作。
TraceSage 是一款采用MIT许可的新兴本地优先可观测性工具,专为LangChain和LangGraph设计,完全在您的机器上运行,提供实时拓扑图、逐步重放、令牌追踪和OpenTelemetry导出功能,无需将数据发送至云端。
GreptimeDB v1.1.2 是一个补丁版本,修复了定时 Flows 中 now() 的绑定问题,以确保 EVAL INTERVAL 窗口的确定性。此外还修复了以下问题:Kafka SASL 密码在调试输出中的屏蔽、GC 索引文件列表、parquet 元数据缓存大小、Prometheus 标签发现扫描以及 PromQL 时间二元聚合。建议用户升级。
本文认为,ClickHouse 凭借其处理高吞吐量、时序日志的性能优势,解决了长期以来日志管理的痛点,从而成为可观测性领域的主流数据库。
文章认为,诊断——用操作术语解释代理为何失败以及接下来安全做什么——是生产代理栈中缺失的一等技能,比让代理听起来聪明更重要。
代码代理成本正在上升,原因是 Claude Code、Cursor 和 Copilot 等工具的日志记录分散;LangChain 的 LangSmith 提供统一的追踪和成本可见性,帮助团队监控和优化支出。