即使是(非常)嘈杂的LLM评估器也有助于改进AI智能体

Hacker News Top 新闻

摘要

TensorZero的一篇博文认为,即使是噪声很大的LLM评估器,也能用于离线的智能体选择和改进,因为通过对大量样本取平均,噪声会被抵消,从而能够可靠地对智能体进行排名。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/05/29 16:20

# 即使(非常)嘈杂的 LLM 评估器也能有效改进 AI 智能体 · TensorZero 来源:https://www.tensorzero.com/blog/even-very-noisy-llm-evaluators-are-useful-for-improving-ai-agents/ 2026 年 5 月 12 日 · Alan Mishler **开发可靠的 LLM 评估器出奇地困难:它们往往噪声很大,与从业者真正关心的指标或结果之间的相关性很差。**有时目标是可直接测量的,但评估器仍然与专家意见不一致(例如,关于正确性或对源文档的忠实度)。其他时候,目标只能通过代理指标来获取(例如,通过测试的代码是否满足用户需求)。有时目标根本难以观察(例如,客户是否真的对交互感到满意)。 为什么开发可靠的 LLM 评估器如此困难?基于规则和经典的 NLP 指标往往很脆弱,并且遗漏了重要的语义维度。¹ (https://doi.org/10.1145/3485766),² (https://arxiv.org/abs/2209.12356) 学习到的奖励模型容易受到分布偏移³ (https://arxiv.org/abs/2311.14743) 和奖励黑客攻击。⁴ (https://proceedings.mlr.press/v202/gao23h.html) 对 LLM 作为评判器的研究反复记录到了系统性偏差和局限性:评判器严重受表面风格影响,⁵ (https://arxiv.org/abs/2604.23178) 倾向于更长的回复而非质量相似的较短回复,⁶ (https://openreview.net/forum?id=CybBmzWBX0) 在重复的评估器和轻微提示变化中不一致,⁷ (https://arxiv.org/abs/2405.01724) 通常与人类判断对齐较差,⁸ (https://doi.org/10.18653/v1/2025.findings-emnlp.1036) 并且可能与它们旨在预测的下游结果相关性较弱。⁹ (https://arxiv.org/abs/2604.00022) 评估器质量可以从两个粒度进行衡量: - ***输出级相关性*衡量其对单个输出的评分与真实世界结果的匹配程度。**它主导生产工作流(例如,护栏),其中决策依赖于单个输出,而嘈杂的评估器并不可靠。如果评估器在输出级相关性上较低,我们称其对于某个指标或感兴趣的结果是*嘈杂的*。 - ***智能体级相关性*衡量其对多个输出的平均评分与智能体真实世界质量的匹配程度。**它主导离线变体选择(例如,选择最佳提示或模型),并且与输出级相关性不同,它通常随着样本量增加而上升,因为逐输出噪声会平均掉。 **即使是极其嘈杂的评估器,对于离线选择也可能是可靠的:足以现在交付更好的智能体,并随着时间的推移持续改进它们。** ## 为什么嘈杂的评估器仍能对智能体进行排序 **关键洞察在于,即使是非常嘈杂的评估器,其得分在*平均*意义上也可能高于真正质量更高的智能体:噪声会在多个样本中被平均掉。** 为了形式化这一点,假设我们有两个要比较的智能体,AA 和 BB。令 μA\\mu\_A 和 μB\\mu\_B 分别表示 AA 与 BB 在感兴趣的问题设置中*真实得分*的均值,其中*真实得分*指我们理想中想要测量的东西,比如智能体处理客户查询的好坏程度,或者它是否生成了可运行的代码。假设得分越高越好。那么,如果 μA > μB\\mu\_A \> \\mu\_B,我们就说 AA 优于 BB。 现在假设我们有一个评估器,其得分可视为真实得分的嘈杂版本。以下是三个假设样本,分别对应真实得分和评估器得分,用于噪声水平逐渐增大的评估器: 轻微噪声 中等噪声 非常大噪声 三个评估器的真实得分(x 轴)和评估器得分(y 轴)的假设样本,噪声依次增大。虚线标记了 y = x(完美评估器)。最左边的评估器足够准确,可以在生产环境中判断单个输出。最右边的则不行:它对任何单个输出的判断过于嘈杂,不可信任。 然而,如果我们离线使用评估器在 AA 和 BB 之间进行选择,那么我们不需要每个单独的值都准确。我们只需要评估器告诉我们哪个智能体总体更好。给定足够大的评估样本,所有三个评估器都能做到这一点。 假设智能体 AA 的真实得分均值 μA = 0.6\\mu\_A = 0.6,智能体 BB 的 μB = 0.3\\mu\_B = 0.3,因此 AA 是更好的智能体。下面是与上图相同的散点图,但每个输出现在根据来自哪个智能体进行了着色。令 μ^A\\widehat\{\\mu\}\_A 和 μ^B\\widehat\{\\mu\}\_B 表示每个智能体的平均评估器得分,在每个图上以水平虚线显示。在所有三个初始样本中,μ^A > μ^B\\widehat\{\\mu\}\_A \> \\widehat\{\\mu\}\_B,这意味着评估器正确地引导我们选择了更好的智能体。 智能体 A 智能体 B μ^A\\hat\{\\mu\}\_A μ^B\\hat\{\\mu\}\_B 轻微噪声 中等噪声 非常大噪声 从图 2 的真实得分分布中抽取的样本(智能体 A 均值 0.6,智能体 B 均值 0.3;每个智能体 30 个样本),评估器得分在 y 轴上。水平虚线标记了每个智能体的经验平均评估器得分(μ^\\hat\{\\mu\});对角线标记了 y = x。采样细节对于每个智能体,我们将真实得分的分布建模为 Beta 分布,参数由其均值 μ∈(0,1)\\mu \\in \(0, 1\) 和固定浓度参数 κ>0\\kappa \> 0 决定: S ~ Beta(κμ, κ(1−μ))S \\sim \\text\{Beta\}\\left\(\\kappa\\mu,\\; \\kappa\(1 \- \\mu\)\\right\)。分布的均值正好是 μ\\mu,增大 κ\\kappa 会使质量更紧密地集中在 μ\\mu 附近。我们使用 κ=5\\kappa = 5,μA=0.6\\mu\_A = 0.6,μB=0.3\\mu\_B = 0.3,这为每个智能体提供了一个单峰分布,且宽度适中,同时使两者在视觉上具有可比性。 智能体 A 智能体 B 智能体 A(μA=0.6)和智能体 B(μB=0.3)的真实得分分布,建模为浓度 κ=5 的 Beta 密度。垂直虚线标记了每个智能体的均值。对于每个噪声为 σ\\sigma 的评估器,真实得分为 S 的输出的评估器得分为 V = clip(S + ε, 0, 1),ε ~ N(0, σ2)V = \\text\{clip\}\(S \+ \\varepsilon,\\; 0,\\; 1\),\\qquad \\varepsilon \\sim \\mathcal\{N\}\(0, \\sigma^2\),其中 σ=0.03, 0.12, 0.25\\sigma = 0.03,\\; 0.12,\\; 0.25 分别对应轻微、中等和非常大噪声的评估器。每次点击“抽取新样本”按钮,都会显示一个新的随机实现,每个智能体有 N=30N = 30 条轨迹;经验均值 μ^A, μ^B\\widehat\{\\mu\}\_A, \\widehat\{\\mu\}\_B 是每个智能体样本中评估器得分的平均值。 尽管从左到右样本的噪声越来越大,但它们一旦被平均,仍然倾向于产生正确的排序(μ^A > μ^B\\widehat\{\\mu\}\_A \> \\widehat\{\\mu\}\_B)。当然,这些值是随机的,因此经验均值总是有一定的概率误导我们,将较差的智能体指向为更好的。这种可能性的大小取决于几个因素: - **智能体之间的分离程度。** μA\\mu\_A 和 μB\\mu\_B 之间的差距相对于得分的方差越大,就越容易在噪声下保持正确的排序。 - **评估器的噪声水平。** 噪声较小的评估器会缩小 μ^A\\widehat\{\\mu\}\_A 和 μ^B\\widehat\{\\mu\}\_B 的分布范围(降低方差),从而在给定的样本量下更有可能得到正确的排序。 - **我们拥有的评估器样本数量。** 随着样本量 NN 的增长,经验均值会集中在其期望值附近,因此更大的评估数据集能提供更可靠的比较——无论智能体之间的分离程度如何,也无论评估器多么嘈杂。 一般来说,只要有足够大的评估数据集,即使是嘈杂的评估器也能可靠地区分较强和较弱的智能体。 评估数据集需要多大?可靠区分两个智能体所需的样本量与它们之间性能差距的平方成反比——将差距减半大约会使所需样本量翻四倍。这种平方缩放关系源于均值抽样分布随着 NN 收紧的方式:样本均值的方差随 1/N 减小,因此其标准误差随 1/√N 减小,而要可靠地分辨大小为 Δ 的差距,需要标准误差相对于 Δ 足够小——即 NN 需要随 1/Δ² 增长。上面的交互式图表具有说明性:在差距为 0.30 且每个智能体仅有 N=30 个样本的情况下,即使三个评估器中噪声最大的那个,也基本上每次抽取都能正确排序。对于在感兴趣的结果上相差 5 到 10 个百分点的智能体(实践中典型的幅度),即使是一个相当嘈杂的评估器,也可以在几百到几千个示例上以高概率给出正确的排名。 只要评估器不存在系统性偏向较差变体的偏差,上述论点就成立。 形式化论证与失败模式本节形式化地论证了经验评估器均值在足够多的样本下可以恢复智能体的真实排序,并讨论了何时会失败。 令 xx 为智能体输出,S(x)S\(x\) 为 xx 的真实得分,即我们理想中要测量的东西。每个智能体都会产生一个轨迹 xx 的分布,这些分布可以以任意方式不同。也许 AA 倾向于产生长而详细的回复,而 BB 倾向于短而简洁。或者 AA 比 BB 更容易产生幻觉。平均得分 μA\\mu\_A 和 μB\\mu\_B 是这些分布上的期望值,我们用 EA\\mathbb\{E\}\_A 和 EB\\mathbb\{E\}\_B 表示,因此 μA = EA[S(x)],\\mu\_A = \\mathbb\{E\}\_A\[S\(x\)\], μB = EB[S(x)].\\mu\_B = \\mathbb\{E\}\_B\[S\(x\)\]。 现在让 VV 成为一个评估器,使得 V(x)V\(x\) 是评估器分配给输出 xx 的得分。定义噪声项 ε(x) := V(x) − S(x)\\varepsilon\(x\) := V\(x\) \- S\(x\)。那么我们有 V(x) = S(x) + ε(x). (1)V\(x\) = S\(x\) \+ \\varepsilon\(x\)\. \\tag\{1\}经验评估器均值通常收敛到真实的总体评估器均值: μ^A → EA[V(x)], μ^B → EB[V(x)]。\\widehat\{\\mu\}\_A \\rightarrow \\mathbb\{E\}\_A\[V\(x\)\], \\\\ \\widehat\{\\mu\}\_B \\rightarrow \\mathbb\{E\}\_B\[V\(x\)\]。 因此,为了使经验均值以高概率引导我们选择更好的智能体,我们需要期望评估器得分镜像智能体的真实排序。即,我们希望以下性质成立: EA[V(x)] > EB[V(x)] ⟺ EA[S(x)] > EB[S(x)] (2)\\mathbb\{E\}\_A\[V\(x\)\] \> \\mathbb\{E\}\_B\[V\(x\)\] \\iff \\mathbb\{E\}\_A\[S\(x\)\] \> \\mathbb\{E\}\_B\[S\(x\)\] \\tag\{2\}对于所有候选智能体对 AA 和 BB。根据式 (1) 和期望的线性性质,我们有 EA[V(x)] = EA[S(x)] + EA[ε(x)],\\mathbb\{E\}\_A\[V\(x\)\] = \\mathbb\{E\}\_A\[S\(x\)\] \+ \\mathbb\{E\}\_A\[\\varepsilon\(x\)\], EB[V(x)] = EB[S(x)] + EB[ε(x)]\\mathbb\{E\}\_B\[V\(x\)\] = \\mathbb\{E\}\_B\[S\(x\)\] \+ \\mathbb\{E\}\_B\[\\varepsilon\(x\)\] ⇒ (EA[V(x)] − EB[V(x)]) = (EA[S(x)] − EB[S(x)]) + (EA[ε(x)] − EB[ε(x)])。\\begin\{aligned\} \\implies \\left\(\\mathbb\{E\}\_A\[V\(x\)\] \- \\mathbb\{E\}\_B\[V\(x\)\]\\right\) =\{\} & \\left\(\\mathbb\{E\}\_A\[S\(x\)\] \- \\mathbb\{E\}\_B\[S\(x\)\]\\right\) \+ \{\} \\\\ & \\left\(\\mathbb\{E\}\_A\[\\varepsilon\(x\)\] \- \\mathbb\{E\}\_B\[\\varepsilon\(x\)\]\\right\) \\end\{aligned\} 由此我们看到,式 (2) 可以通过多种方式满足。例如,如果噪声项在两个分布上平均为零(一个常见假设),那么我们有 (EA[V(x)] − EB[V(x)]) = (EA[S(x)] − EB[S(x)]),\\left\(\\mathbb\{E\}\_A\[V\(x\)\] \- \\mathbb\{E\}\_B\[V\(x\)\]\\right\) = \\left\(\\mathbb\{E\}\_A\[S\(x\)\] \- \\mathbb\{E\}\_B\[S\(x\)\]\\right\), 由此式 (2) 立即成立。即使噪声并不平均为零——意味着评估器系统性地低估或高估真实得分——只要它对两个智能体平均为相同的值,我们仍然会得到相同的结果。更一般地,只要每个智能体的噪声差距 EA[ε(x)] − EB[ε(x)]\\mathbb\{E\}\_A\[\\varepsilon\(x\)\] \- \\mathbb\{E\}\_B\[\\varepsilon\(x\)\] 的符号不是错误的,并且其大小不足以逆转真实得分差距 EA[S(x)] − EB[S(x)]\\mathbb\{E\}\_A\[S\(x\)\] \- \\mathbb\{E\}\_B\[S\(x\)\],式 (2) 就可以成立。等价地,评估器可以具有任意的智能体特定偏差,只要这些偏差不会强烈地偏向较差的智能体,以至于推翻其真实的劣势。 当然,在实践中,我们永远不会直接观察到期望 EA[V(x)]\\mathbb\{E\}\_A\[V\(x\)\] 和 EB[V(x)]\\mathbb\{E\}\_B\[V\(x\)\];我们只有基于有限评估数据集计算出的经验均值 μ^A, μ^B\\widehat\{\\mu\}\_A, \\widehat\{\\mu\}\_B,并且在任何给定的抽取中,这些经验均值可能与真实排序不一致。我们的主张是,当式 (2) 成立且轨迹被适当采样时,不一致的概率会随着评估数据集的增大而消失: P(μ^A > μ^B) → 1 当 N → ∞ (3)\\mathbb\{P\}\\left\(\\widehat\{\\mu\}\_A \> \\widehat\{\\mu\}\_B\\right\) \\to 1 \\quad \\text\{as\} \\quad N \\to \\infty \\tag\{3\}其中 NN 是评估数据集的大小,并且不损失一般性地假设 μA > μB\\mu\_A \> \\mu\_B。简单来说:只要有足够大的评估数据集,我们将以任意高的概率正确识别更好的智能体——即使评估器在单个轨迹上是嘈杂的。我们在此省略形式化证明,但 (3) 可以在典型采样方案下成立,例如独立同分布采样、平稳遍历过程或足够弱依赖的其他形式。 **这会在哪里失效。** 上述条件足以使经验评估器均值以高概率恢复真实排序,但在实践中并不总是满足。一些常见的失败模式: - **区域特定偏差。**¹⁰ (https://arxiv.org/abs/2603.00039) 如果评估器的偏差在得分范围内变化——例如,无论正确性如何,它都会给看起来精致的输出额外加分——并且被比较的智能体将其输出集中在不同区域,那么 EA[ε(x)] ≠ EB[ε(x)]\\mathbb\{E\}\_A\[\\varepsilon\(x\)\] \\neq \\mathbb\{E\}\_B\[\\varepsilon\(x\)\],每个智能体的噪声差距可能会翻转式 (2) 的符号。更多的数据会导致经验均值收敛到有偏差的值,而不是真相。 - **离线与在线之间的分布偏移。** 离线测试集可能与部署的智能体在生产环境中遇到的分布不匹配。如果评估器的噪声在这两个分布上表现不同,那么离线排序不一定能预测在线行为——即使离线论证顺利通过。 - **强依赖或非平稳性。** 收敛声明 (3) 容忍独立同分布、遍历或弱依赖采样,但强相关的轨迹可能会阻止经验均值收敛。 这些失败模式并非离线智能体选择所独有:它们会影响评估器的任何使用,无论是在线还是离线。 ## 这在真实基准测试中是如何运作的 为了在真实评估数据中看到这种现象,我们在五个任务上运行了 LLM 生成的评估器:Gridworld、Wordle、数据抽取(NER)、数据抽取(NDA)和商业管理(Business Management)。每个任务评估了 25 个智能体变体(不同的提示和模型),每个变体有 50 个测试轨迹。 每个环境都附带一个目标指标,该指标通过编程计算,并作为任何给定轨迹的真实基准:Gridworld 和 Wordle 的成功或失败,数据抽取(NER)与黄金注释的精确匹配,数据抽取(NDA)与黄金注释的 F1 分数,以及商业管理完成的子任务数量。 对于每个任务,我们计算两种相关性

相似文章

构建AI代理时如何进行评估与可观测性?

Reddit r/AI_Agents

作者探讨了在生产环境中评估和监控AI代理所面临的挑战,包括离线评估与在线评估、LLM作为评判、链路追踪和成本追踪,并提到Langfuse、LangSmith等工具,但更关注底层流程。

评估智能体非常困难

Reddit r/AI_Agents

本文讨论了评估基于LLM的智能体执行多步推理的挑战,指出仅对最终输出进行评分是不够的,因为智能体可能走错路径但偶然恢复,并提出了如何在不手动审查的情况下评估轨迹的问题。