eval-tools

标签

Cards List
#eval-tools

你们是如何在评估失败后,得到一个能在生产环境中保持稳定的提示修复的?

Reddit r/AI_Agents · 2026-07-20

一场讨论,比较了用于修复提示失败的LLM评估和可观测性工具(LangSmith、Weave、Phoenix、Braintrust、Galileo、Opik),并介绍了一个开源平台,该平台在单个跟踪上整合了从评估到修复的完整循环。

0 人收藏 0 人点赞
#eval-tools

@DeRonin_: 如何自然地构建你自己的自我改进智能体:一个自我改进的智能体从自己的错误中学习并重写……

X AI KOLs Timeline · 2026-06-29 缓存

一份实用指南,解释了构建自我改进AI智能体的三个层级,从手动循环到自动化设计,并推荐了工具和框架。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈