@AdamRLucek:什么是在线评估?大多数智能体评估是“离线”运行的:一个预制的输入数据集经过智能体,然后对中间步骤或最终输出进行评分。

X AI KOLs Following 新闻

摘要

解释了AI智能体在线评估的概念,即通过在实时流量中运行智能体并随时间追踪其表现来测量性能,与使用固定数据集的离线评估形成对比。

什么是在线评估? 大多数智能体评估是“离线”运行的:一个预制的输入数据集经过智能体,然后对中间步骤或最终输出进行评分。它们回答的问题是“这个版本比上一个更好吗?” 在线评估回答的是另一个问题:“智能体还在正常工作吗?”它不再使用固定数据集,而是在智能体处理实时流量时测量其某个维度,并随时间进行追踪。我们来讨论一下它们的工作原理以及如何设置。
查看原文
查看缓存全文

缓存时间: 2026/06/17 15:58

什么是在线评估?

大多数代理评估采用“离线”方式运行:一个预先构建的数据集输入代理,然后对中间步骤或最终输出进行评分。它们回答的问题是:“这个版本比上一个更好吗?”

在线评估回答的是另一个问题:“代理仍在正常工作吗?”它们不依赖固定数据集,而是衡量代理在实时流量中运行时的某个维度,并进行持续追踪。接下来,我们讨论它们的工作原理以及如何设置。

首先,两者在结构上有何不同?

离线评估时,我们比较代理的行为与构建时定义的“参考答案”。评估是一个输入和预期输出组成的数据集,经过精心设计以捕捉我们期望的行为,从而让我们能在不同版本间比较性能。

在线评估的重点从比较转向了监控。我们把这个精心设计的数据集换成实时生产数据,并在输出生成时直接评分。这带来两个变化:我们无法控制输入(它们来自真实用户),也没有参考答案来度量输出。

这些限制决定了在线评估的设计方式。它们通常分为两类:

  1. 启发式评估:以代码形式直接对追踪记录运行,衡量确定性信号,如步骤数、响应长度或内容匹配。

  2. 大语言模型作为评判(LLM-as-a-judge):用于主观、概率性的指标,如质量、有用性、幻觉或其他应用特定的判断。我们根据自然语言规则(即提示词)对输出进行评分。

重要的是,这样我们可以监控代理的实时性能(类似于可观测性),观察随时间变化的趋势,并在某个指标低于阈值时收到警报。结合启发式函数和LLM-as-a-judge实现,我们可以从实际使用中捕获硬性指标和模糊指标,而这些指标可能不会在受控的离线实验中显现出来。

在线评估和离线评估并非相互竞争。相反,它们往往相互促进。在线监控发现存在问题的追踪记录,这些记录经过标注和错误分析,最终转化为离线评估,以固化行为并在代理迭代过程中捕获回归问题。两者共同构成了完整的评估循环,为代理性能提供了全面视图。

相似文章

自动化智能体评估的实证研究

arXiv cs.CL

本文介绍了 EvalAgent,这是一个通过编码领域专业知识来自动化 AI 智能体评估的系统,旨在解决标准编程助手在此任务中的局限性。此外,本文还提出了用于测试评估流程的基准 AgentEvalBench,并展示了在评估可靠性方面的显著提升。

构建AI代理时如何进行评估与可观测性?

Reddit r/AI_Agents

作者探讨了在生产环境中评估和监控AI代理所面临的挑战,包括离线评估与在线评估、LLM作为评判、链路追踪和成本追踪,并提到Langfuse、LangSmith等工具,但更关注底层流程。

评估如何推动企业AI的下一个篇章

OpenAI Blog

OpenAI 发布了一个面向业务领导者的框架,说明如何使用 AI 评估(evals)来衡量和改进组织环境中 AI 系统的性能,区分用于模型开发的前沿评估和为特定业务工作流定制的上下文评估。