标签
这篇文章通过一个简短的教程,介绍了如何使用 LangSmith CLI 来管理 trace 并构建评估数据集。
作者在流体模拟任务上测试了 Qwen3.8 27B 模型,通过迭代提示取得了成功,并分享了实现过程,包括跟踪记录和 GitHub 仓库。
这篇文章推荐了 Langfuse 团队关于使用 Traces 设计 Agent/LLM 评测指标的最佳实践,包括目标指标、防护栏指标和运营指标,并强调从错误分析开始,保持指标少而精、可行动。
Traceway 是一个开源、自托管的可观测性平台,使用 OpenTelemetry 统一日志、跟踪、指标和异常,具有会话重放和 AI 可观测性等功能。
掌控Agent学习循环并租赁模型;私有评估、追踪和记忆会随时间累积。
在aiDotEngineer世界博览会上,Vtrivedy10讨论了从追踪数据中进行数据挖掘是一种高杠杆率的实践,有助于理解AI智能体、大规模整理数据并运行改进循环。
这条推文分享了智能体可观测性的最佳实践,涵盖指标、日志和追踪,用于调试和优化生产环境中的AI智能体。
这篇推文推荐了一篇关于生产环境中智能体架构的文章,重点介绍了使用Traces诊断问题并实施迭代改进循环的做法。
Yohei Nakajima强调,在activegraph上构建智能体会自动产生一等公民的追踪记录,这不同于事后添加的解决方案,并通过一个编码智能体实验进行了演示。
马丁·卡萨多的一条推文,强调了一种解决方案,该方案解决了大规模向AI智能体暴露追踪数据这一难题,并平衡了成本与AI的杠杆作用。
Adam Łucek 探讨了 LangChain 如何使用追踪数据为生产环境中的代理构建评估。
Respan推出了一款AI可观测性平台,能够自动捕获追踪记录中的问题,旨在取代基于智能体工作流程的手动调试。
Engine 是一种新工具,它将 Agent 可观测性追踪与自动修复和评估连接起来,为工程团队闭环 Agent 改进流程。
LangSmith Engine 是一个位于追踪数据之上的智能体,能够自动识别问题,并主动建议代码更改或添加评估器等行动项。