LangChain: Jev-as-a-judge 现已在 LangSmith 中可用。对每个生产跟踪进行评分,而非抽样检查。每个跟踪检查更多标准...
摘要
LangSmith 现已集成 Jev,一个 System One 模型,用于快速且经济的代理跟踪在线评估,实现更广泛的评分和安全检查,无需高昂成本。
查看缓存全文
缓存时间: 2026/09/21 21:39
Jev-as-a-judge 现已在 LangSmith 上线。
✅ 对每个生产环境追踪进行评分,而非抽样。 ✅ 每条追踪可检查更多评判标准,且成本不会显著增加。 ✅ 能足够快速地发现安全或隐私问题,从而触发自动化响应。
立即试用,并告诉我们您的想法!
Jev 现已登陆 LangSmith Evals
来源:https://www.langchain.com/blog/jev-is-now-available-in-langsmith-evals Jev 现已作为评估法官集成至 LangSmith。它为团队提供了一种快速、低成本的方式来评估开放式的智能体行为,并将结果转化为可在 LangSmith 中跟踪的结构化反馈。
下文我们将解释为何像 Jev 这样的系统一模型对智能体评估如此有用,分享我们测试时的发现,并逐步介绍如何为在线评估设置 Jev 作为法官的评估器。
立即访问任意追踪项目的 Evaluators(评估器) 标签页,体验 Jev-as-a-judge (https://smith.langchain.com/)。
智能体评估简史
早在 2023 年,当我们开始构建智能体(当时我们多称之为 LLM 应用)时,主要的评估方法基于代码。同年晚些时候,研究人员提出了 LLM-as-a-judge (https://arxiv.org/abs/2306.05685)。此后,基于代码的评估和 LLM-as-a-judge 便成为评估智能体的两种主要方式。
基于代码的评估器检查特定、确定性的条件:智能体是否调用了某个工具?输出是否匹配某种模式?某个字段是否存在?这种方式快速可靠,但它只能覆盖智能体运行前能被完全限定的那一小部分行为。由于智能体具有非确定性,对于同一问题,一个智能体可能以三种不同的有效方式解决,但仅期望其中一种方式的基于代码的检查将会失败。
LLM-as-a-judge 评估器则弥补了这一差距。你将智能体追踪、评分指令以及评分标准交给一个 LLM 法官,它会在自由文本中推理该追踪,然后返回一个裁定。然而,这种灵活性是有代价的。LLM-as-a-judge 评估器比函数调用运行得更慢、成本更高,并且由于其非确定性,相同的输入在不同次运行中可能产生不同的裁定。此外,将自由文本转换为结构化输出的步骤本身就是一个错误源,独立于法官推理是否正确。
如今,像 Jev (https://typesafe.ai/blog/introducing-system-one-models-and-jev) 这样的系统一模型引入了第三种智能体评估方式。它在一定程度上牺牲了基于代码评估的速度,以换取评估开放式智能体行为的灵活性,且成本仅为 LLM 法官的一小部分。
什么是 Jev?
Jev 并非传统的 LLM,也不生成文本。TypeSafe AI 团队称其为系统一模型 (https://typesafe.ai/blog/introducing-system-one-models-and-jev):
📖 系统一模型是一类 AI 模型,旨在做出快速、结构化的决策,供软件直接使用。系统一模型评估一个 状态 (state) (https://docs.typesafe.ai/concepts/state),并返回类型化的答案和概率。
对于评估而言,状态可以是智能体追踪、单条消息或任何你想要评估的上下文。问题定义了你想要根据状态来评估的标准,例如响应是否泄露了个人身份信息(PII)、用户的意图是什么,或者用户看起来有多沮丧。Jev 可以回答三类问题:(1) 布尔型 (noul) 返回“是/否”概率;(2) 选择型 (choice) 从一组选项中选择一个;(3) 评分型 (score) 在一个有序量表上对状态进行评级。每个答案都是类型化返回的,而不是一段需要转换成结构化输出的生成文本。
Jev 能回答的三种问题类型,此处使用本文的反馈键示例:PII 泄露(布尔型)、用户意图(选择型)和用户沮丧度(评分型)。
为何 Jev 适合智能体评估?
Jev 的三个特点直接对应了智能体评估的痛点。据 TypeSafe AI 称,在分类任务上,Jev 比同类 LLM 成本低约 450 倍,速度快约 200 倍 (https://typesafe.ai/blog/introducing-system-one-models-and-jev),并且它可以并行评估关于同一状态的多个问题。
成本是团队评估智能体的频率常低于期望的一个普遍原因。每次评估都存在权衡:评分更多智能体运行次数、评估更多评判标准,或测试更多变更,测试成本都会成比例增长。对于多智能体和高流量使用场景,一个每次评估花费几美分的 LLM 法官,在生产流量、大规模数据集以及针对每次模型或提示词变更的回归测试中,其成本会迅速变得昂贵。团队最终不得不减少评估次数以控制成本,而这延缓了构建优秀智能体所依赖的反馈循环。Jev 法官只需其成本的一小部分,便能消除这种权衡。
借助 Jev-as-a-judge,你可以对每条追踪进行评分,而非抽样;可以检查每条追踪的更多评判标准;甚至可以重复运行相同的评判以评估法官的一致性。法官的成本越低,你能承担得起的智能体行为评估就越多,智能体改进的循环也就越紧密。
速度对于在线评估(法官对实时流量进行评分)至关重要。由于速度比 LLM 法官快约 200 倍,Jev 法官能更好地跟上流量的节奏。这对标记安全或隐私风险的反馈键(如 PII 泄露、提示注入或毒性)尤为重要,你可以为这些反馈键设置警报,触发 Webhook 以自动化响应。法官的运行速度越快,从问题发生到采取措施的时间窗口就越小。
并行化改变了你能在单条智能体追踪上评估的标准数量。Jev 在一次请求中并行评估所有问题,因此对一条追踪评分多个反馈键(如 PII 泄露、用户意图和用户沮丧度)的成本,仅比评分单个反馈键高出一点点。
💡 系统一模型并行评估请求中的所有问题。添加问题几乎不会改变响应时间,且成本仅增加为额外问题所需的 tokens,这些成本很低。
相比之下,LLM 法官要么需要为每个标准发起单独的调用,要么必须在一个提示词中顺序推理所有标准,且输出 tokens 数量随标准数量成比例增长。
系统一模型很好地解决了这些痛点,但这并不意味着 LLM 法官已经过时。经过微调的开源模型可以成为成本远低于前沿模型的有效法官,而对于需要附带推理过程的开放性标准,LLM 法官仍然是更好的工具。当你需要做出的是一个狭窄且类型化的决策,并且需要大规模执行时,Jev 非常适用。
Jev-as-a-judge 真的有效吗?
我们在 Jev-as-a-Judge for Agent Evals (https://www.langchain.com/blog/jev-agent-evals-langsmith#evaluation-with-jev) 中对 Jev 进行了测试,将其与 GPT-5.6 Luna、GPT-5.6 Terra 和 Claude Sonnet 4.6 在准确性、一致性、速度和成本方面进行了比较。Jev 更准确,一致性显著更高,并且比 LLM 法官更快、更便宜。
Jev 在每一项决策上都匹配了人类评审员的结果,其方差比 LLM 法官低 92 到 913 倍。它平均每次调用耗时 0.44 秒,而 LLM 法官为 2.16 至 2.83 秒。按每次调用 $0.00035 计算,运行完整评判集 Jev 成本为 $0.34,而 GPT-5.6 Luna 为 $0.39,GPT-5.6 Terra 为 $2.90,Claude Sonnet 4.6 则为 $28.17。
这只是一个针对单一智能体的测试,但结果是一个有希望的早期信号,表明 Jev-as-a-judge 是继基于代码的评估和 LLM-as-a-judge 之后,一种可行的第三类智能体评估方式。
如何在 LangSmith 中使用 Jev-as-a-judge
TypeSafe 现在是 LangSmith 的模型提供商,Jev 可作为模型使用。设置 Jev-as-a-judge 评估器的路径与设置 LLM-as-a-judge 评估器相同。关键区别在于,Jev-as-a-judge 评估器定义的是一个状态和一组类型化的问题,而非一个提示词和评估标准。
- 添加 TypeSafe API 密钥。 从“Settings(设置)”中,打开“Provider secrets(提供商密钥)”并点击“+ Secret(+ 密钥)”。选择 TypeSafe 作为提供商,并将你的 TypeSafe API 密钥粘贴到
TYPESAFE_API_KEY字段中。你可以从你的 TypeSafe AI 账户创建一个。
%20TypeSafe%20API%20Key.png)
- 添加评估器。 从你的追踪项目中,打开“Evaluators(评估器)”标签页并点击“+ Evaluator(+ 评估器)”。在“Create from scratch(从头创建)”下,选择“LLM-as-a-Judge Evaluator(LLM 作为法官评估器)”。
%20Add%20an%20evaluator.png)
- 选择 TypeSafe 作为提供商。 为你的 Jev-as-a-judge 评估器命名。在“Prompt & Model(提示词和模型)”下,打开“Model Configuration(模型配置)”,选择 TypeSafe 作为提供商,
jev-latest作为模型。请注意,TypeSafe 目前不提供零数据保留策略,因此发送用于评估的提示词和输出可能被提供商保留。
.png)
- 定义状态。 配置好模型后,定义 Jev 将要评估的状态或上下文,通过映射运行(run)或线程(thread)变量来实现。与 LLM 法官不同,状态不应包含评分指令。那些指令放在下一步的问题中。
%20Define%20state.png)
- 添加问题。 在“Feedback Configuration(反馈配置)”下,为你想要根据状态评估的每个标准添加一个问题。每个问题成为一个反馈键。将布尔型问题表述为一个“是/否”问题,其中高概率表示“是”;为选择型问题提供其完整的选项集;为评分型问题提供其从低到高的等级。由于 Jev 在单次调用中评估所有问题,因此添加第二个或第三个问题仅会使成本略微增加。
%20Add%20questions.png)
- 开始评估。 保存评估器。Jev-as-a-judge 评估器将开始对传入的运行或线程进行评分,每个问题都会显示为一个独立的反馈键。然后,你可以像处理 LangSmith 中的任何其他反馈一样,对这些键进行筛选、绘图,或设置警报/自动化操作。
%20Feedback.png)
开始使用
Jev-as-a-judge 今天即可在 LangSmith 中使用。
登录或注册 (https://smith.langchain.com/) LangSmith,然后在任意追踪项目中打开“Evaluators(评估器)”标签页,添加一个“LLM-as-a-Judge”评估器,并选择 TypeSafe 作为提供商即可试用。有关在线评估的更多细节,包括筛选器和高级选项,请参阅在线评估指南 (https://docs.langchain.com/langsmith/online-evaluations-llm-as-judge)。
如果你尝试在你的智能体上使用 Jev 作为法官,我们很想知道它的表现如何,特别是与你目前使用的 LLM 法官相比。请在 论坛 (https://forum.langchain.com/) 上分享你的发现,或在 X (https://x.com/LangChain) 上 @我们。
要了解 Jev 如何在评估之外融入智能体循环,包括模型路由和工具风险门控,请阅读 《使用 Jev 构建控制框架》 (https://www.langchain.com/blog/building-a-harness-with-jev)。
如果你想了解更多关于使用 Jev 构建智能体的信息,我们将于 9 月 22 日(星期二)与 TypeSafe AI 团队举办一场直播:https://events.langchain.com/webinar/building-a-harness-with-jev/*
相似文章
@LangChain:我们对 Jev 与 LLM 裁判在准确性、可重复性、延迟和成本方面进行了测试,以查看 System One 模型是否能够……
本文评估了来自 TypeSafe AI 的 System One 模型 Jev 作为一个新的代理评估器,显示它在一致性、速度和成本方面优于 LLM 裁判。
@LangChain: LangSmith 现在支持包括 Jev 和 SemIf 在内的决策模型,让您可以查看每一步的详细情况。现在,您可以:
LangSmith 现在支持决策模型,例如 Jev 和 SemIf,提供每一步的可见性,以帮助更快地调试和理解模型行为。
@LangChain:将编码代理指向 LangSmith CLI,它就能为你构建一个在线的 LLM-as-a-judge:定义评分标准,连接到……
一个关于使用编码代理与 LangSmith CLI 来设置在线 LLM-as-a-judge 以评估 LLM 追踪的教程,所有配置都可从终端进行。
@LangChain: .@CreditGenie_US 已使用 LangSmith 调试了数千条代理追踪。LangSmith 的可追溯性使他们能够看到精确的…
CreditGenie 使用 LangSmith 来调试数千条代理追踪,并从生产数据中生成有针对性的测试问题。
@LangChain: 当您的智能体跌倒时,LangSmith 帮助它们重新站起来。LangSmith Evaluation 让您能够评估性能…
LangSmith Evaluation 通过使用真实生产数据评估性能,帮助提升 AI 智能体质量。