@LanLance24: 推荐这篇 Langfuse 团队成员的文章,主要讲当我们有 Traces 时如何设计 Agent/LLM 评测指标的最佳实践。 少而精、来自线上真实失败的case、能指导决策、会持续更新迭代,才是好的评测指标体系。 > 指标分成三类: 1…
摘要
这篇文章推荐了 Langfuse 团队关于使用 Traces 设计 Agent/LLM 评测指标的最佳实践,包括目标指标、防护栏指标和运营指标,并强调从错误分析开始,保持指标少而精、可行动。
查看缓存全文
缓存时间: 2026/08/19 16:46
推荐这篇 Langfuse 团队成员的文章,主要讲当我们有 Traces 时如何设计 Agent/LLM 评测指标的最佳实践。
少而精、来自线上真实失败的case、能指导决策、会持续更新迭代,才是好的评测指标体系。
指标分成三类: 1、目标指标:你真正想提升的核心质量(比如回答是否真正解决问题、工具是否用对等)。 2、防护栏指标:绝对不能出错的红线(比如安全、合规、格式要求),一旦失败就很严重。 3、运营指标:成本、延迟、请求量等系统运行情况。
最佳实践:先通过错误分析(认真阅读一批真实轨迹,找出实际失败的地方),再结合产品目标来决定要监控哪些指标。挑选指标时要特别注意,指标必须能直接指导行动(比如指标变差时,你会决定回滚代码、回滚提示词,还是排查问题)。
指标是灵活的,不是一成不变的。系统更新后需要要重新执行,长期高分的指标可以直接下掉,同时还要防止为了刷某个指标而过度优化(Goodhart定律)。
Lotte (@lotte_verheyden): Before you write good evals, you have to pick the right things to evaluate. Main take-aways:
- source metrics from failures you see in traces
- keep the set small and maintainable
- only keep a metric if you’d take action when it moves
相似文章
@Xudong07452910: 如果你最近在关注 AI Scientist,我很推荐这篇文章。 现在很多 Research Agent 还是先生成大量实验和假设,再让 Judge 选最好的。 做研究往往是一次失败以后,能不能知道自己哪里理解错了,还有哪些地方没探索过。 …
这篇文章推荐关注AI Scientist,并讨论研究代理如何通过类比模糊测试来学习失败,从而绘制未知地图并指导后续实验。
@jakevin7: 分享一个神级review提示词方法论。 LLM 自我纠正的综述 《When Can LLMs Actually Correct Their Own Mistakes?》结论是:如果没有测试结果、工具输出等可靠的外部反馈,模型仅靠自己反思,…
分享了一个基于LLM自我纠正研究的提示词方法论,强调无外部反馈时模型自查效果有限,推荐对抗式审查等逐步增强的提示策略。
构建AI代理时如何进行评估与可观测性?
作者探讨了在生产环境中评估和监控AI代理所面临的挑战,包括离线评估与在线评估、LLM作为评判、链路追踪和成本追踪,并提到Langfuse、LangSmith等工具,但更关注底层流程。
@Kimberl9633: LangChain 今天连发两记,直接把 agent reliability 往前推了一步:一套统一评估栈,一个不用完整沙箱的代码执行方案。 先说评估。长运行、有状态的 agent 怎么测?Harbor + LangSmith 的组合给出…
LangChain 发布了统一评估栈(Harbor + LangSmith)和基于 WASM+QuickJS 的进程内代码执行方案,旨在提升 AI agent 的评估可靠性与执行安全性。
@rhymeleon: 第一次刷到时只是大致浏览了一下。最近深入研究agent,加上面试官的一些问题,我才真正意识到这篇文章的含金量。 文章对于agent的循环,记忆机制,harness工程,agent测评等都有深入的讲解,推荐大家阅读
用户推荐一篇深入讲解agent循环、记忆机制、harness工程和agent测评的文章,强调其含金量,适合深入研究agent的读者。