谁发生了偏移:系统还是裁判?LLM评估流水线中的随时有效归因方法

arXiv cs.AI 论文

摘要

提出了一种随时有效的归因方法,利用人工标注的锚点集和赌博e-过程,区分LLM评估流水线中的评分偏移来自系统还是裁判,从而消除因裁判静默变更引起的歧义。

arXiv:2606.15474v1 公告类型:新论文 摘要:LLM产品的持续评估依赖于一个被视为黄金标准的强大LLM裁判:一个廉价的监控器对每次交互进行评分,当评分下降时团队会收到警报。但裁判本身也是一个通过API提供的模型,其静默的版本升级或评分提示更新会改变评分方式——因此每次漂移警报都可能是产品变差或裁判变更两种可能。我们通过一个固定的人工标注锚点集来解决这一歧义,当前裁判以稳定的交错频率重新评分这些锚点,并在裁判与人工差距上运行第二个赌博e-过程,以及一个保护窗口规则,返回{无变化,系统,裁判}之一的判定。我们证明了随时有效性、单向识别(只有裁判能移动锚点)、一种归因竞赛(其设计法则是锚点必须跑赢它们所保卫的主过程)以及过程正交性。在两个真实裁判变更场景中,一次静默版本升级在60/60次运行中被检测为裁判漂移,零次误归因到系统;一次污染性的严格提示变更在保护窗口宽度为300时,120次运行中有110次正确归因——而行业默认的滚动z检验在75%的无漂移流中产生误报。所有实验在第二个领域(TL;DR摘要)上重复验证,无需重新调参,并且领域差异正是竞赛所预测的:严格提示变更在该领域对评分影响更大,因此锚点触发更快,归因变得完美(240/240)。该监控器的成本约为对每个项目进行强裁判评分的0.64倍,或在更便宜但灵敏度较低的方案中为0.21倍。
查看原文
查看缓存全文

缓存时间: 2026/06/16 11:45

# 系统还是裁判?LLM评估流水线中的任意时刻有效归因  
来源: https://arxiv.org/html/2606.15474  

###### 摘要  

持续评估LLM产品依赖于一个被视为真实标签的强LLM裁判:一个廉价的监控器对每次交互进行评分,当分数下降时团队会被呼叫。但裁判本身是一个通过API访问的模型,无声的版本升级或评分提示更新会改变其评分方式——因此每次漂移告警都会在“产品变差”和“裁判改变”之间模棱两可。我们通过一个固定的、人工标注的*锚定集*来解决这个歧义,当前裁判以稳定的间隔重新评分该锚定集,第二个关于裁判与人类差距的赌注e过程,以及一个守卫窗口规则,返回\(\{\texttt{none},\texttt{system},\texttt{judge}\}\)中的裁决。我们证明了任意时刻有效性、单向识别(只有裁判可以移动锚点)、归因竞赛(其设计法则是锚点必须跑赢它们守卫的主过程)以及过程正交性。在两个*真实*裁判变化上,一个无声的版本升级在60/60次运行中被检测为裁判漂移,零次误将裁判归因为系统;一个污染性的严格提示变化在守卫宽度为300时,在120次运行中的110次被正确归因——而行业默认的滚动z检验在75%的无漂移流上产生虚警。每个实验在第二个领域(TL;DR摘要)上未调整任何参数即复制,并且领域之间的差异正是竞赛所预测的:严格提示变化在那里更强烈地改变分数,因此锚点触发更快,归因变得完美(240/240)。监控器的运行成本约为强裁判每项评分的0.64倍,在更便宜但更聋的模式下为0.21倍。  

## 1 引言  

大型语言模型产品现在由其他大型语言模型持续评估。LLM作为裁判(Zheng等,2023 (https://arxiv.org/html/2606.15474#bib.bib27))对每次交互进行评分,仪表盘跟踪滚动均值,当分数下降时,值班团队会被呼叫。隐含的契约是裁判是一个固定的标尺,因此分数下降意味着产品下降。但强裁判本身是一个通过API访问的模型:版本升级或无声的提示和政策更新可以改变其评分方式,而没有任何公告,产品也完全没有变化。当监控器触发时,团队面临一个仪表盘无法回答的问题——*哪个东西发生了漂移,系统还是裁判?* 对错误答案采取行动在两个方向上代价高昂:回滚一个健康的产品,或者因为告警被当作“只是裁判”而忽略,从而发布一个真正的回归。这并非假设性的边缘情况,而是已在使用中的工具的一个属性。  

考虑监视裁判的事实上的行业实践:每当新观测到达时,在滚动窗口上使用α=0.05的z检验重新测试裁判与人类的差距。在与我们锚点过程消耗的无漂移流相同的流上运行,该过程在从未发生变化的数据流上产生75%的虚警,并且其“检测”中有16/60次在*变化点甚至不存在之前*就触发了(第5节 (https://arxiv.org/html/2606.15474#S5))。其表面上的警觉性实际上是缺乏误差控制,而非灵敏度:固定α的检验每一步都重新运行,在数据依赖的停止时间上没有有效性保证。持续监测需要*任意时刻有效*的工具——e值和测试超鞅,可以在每一步检查而不会夸大虚警率(Ville,1939 (https://arxiv.org/html/2606.15474#bib.bib22);Waudby-Smith和Ramdas,2022 (https://arxiv.org/html/2606.15474#bib.bib24);Howard等,2022 (https://arxiv.org/html/2606.15474#bib.bib12))。一旦这些工具到位,检测器就能可靠地告诉你*有*东西发生了漂移。*归因*——是系统还是裁判——是剩余的缺口,而这就是我们填补的内容。  

#### 构造。  

我们从成本敏感的团队无论如何都会部署的预测驱动监控器开始:一个廉价裁判μ对*每个*项目评分,昂贵的强裁判y在预算下采样,以及每个分层的预测驱动e过程(Csillag等,2025b (https://arxiv.org/html/2606.15474#bib.bib8);Angelopoulos等,2023 (https://arxiv.org/html/2606.15474#bib.bib1)),该过程累积系统漂移的任意时刻有效证据(第3节 (https://arxiv.org/html/2606.15474#S3))。我们增加一个组件:一个固定的、人工标注的*锚定集* \(\mathcal{A}\),在监控开始前保留,并由*当前*裁判以稳定的间隔重新评分,驱动第二个e过程来观察裁判与其冻结的人类标签之间的差距(第4节 (https://arxiv.org/html/2606.15474#S4))。一个守卫窗口规则将两个停止时间结合成一个\(\{\texttt{none},\texttt{system},\texttt{judge}\}\)的裁决。该构造依赖于一个刻意的非对称性。锚点是冻结的,因此产品的漂移永远无法到达它们——改进系统或破坏它,与这些固定项目上的人类标签的差距不会移动。只有*裁判*的改变才能移动它。因此锚点过程是一个单向镜:它看到裁判的漂移,而看不到其他任何东西。  

#### 贡献。  

1. 锚点构造和守卫窗口归因规则(第4节 (https://arxiv.org/html/2606.15474#S4))——一个人工锚定的、任意时刻有效的e过程,将裁判漂移与系统漂移解开,发出明确的\(\{\texttt{none},\texttt{system},\texttt{judge}\}\)裁决,而不是无差别的告警。  
2. 四个命题(第4节 (https://arxiv.org/html/2606.15474#S4)):锚点族的任意时刻有效性、单向识别(只有裁判可以移动锚点)、归因竞赛以及过程正交性。竞赛命题揭示了一个设计法则——锚点过程必须被配置为*跑赢*它所守卫的主过程,因为被污染的参考否则可能触发虚假的系统告警,而锚点还未追上。  
3. 两个*真实*裁判变化,而不仅仅是合成漂移(第5节 (https://arxiv.org/html/2606.15474#S5)):一个无声的版本升级(gemini-3.1-pro → 3.5-flash)在60/60次运行中被检测为裁判漂移,在所展示的配置下零次误将裁判归因为系统;一个严格提示策略变化确实污染了主监控器,但在守卫宽度W=300时,在120次污染运行中的110次被正确归因——两者都在第二个领域(TL;DR摘要)上以相同的格式复制,且无需调整任何参数。这种复制不仅是对鲁棒性的测试,也是对理论的测试:不变性转移(相同的版本升级在两个领域都留下相同的+0.03到+0.07的特征),并且当领域存在差异时,这些差异正是命题所预测的——严格提示变化在摘要上影响更大,因此锚点触发更快,归因变得完美(240/240),协同配置带向更慢的锚点速率移动,这正是归因竞赛。  
4. 操作性证据表明经典替代方案失败(第5节 (https://arxiv.org/html/2606.15474#S5)):在相同的锚点流上,天真的重复z检验在75%的无漂移流上产生虚警;一个仔细校准的Page-Hinkley检测器虽然控制了虚警预算,但仅在8%的时间内检测到真实的宽松升级,并且需要e过程不需要的保留校准流。  
5. 成本感知基础(第3节 (https://arxiv.org/html/2606.15474#S3)):一个分层预测驱动监控器,以大约每项强评估三分之一成本检测局部盲区回归,配备一个e财富升级触发,比协变量触发的先前规则(后者在偏倚的廉价裁判下要么过度采样至近乎全额评估成本,要么无效读取)便宜得多,同时在最微弱的漂移上仅与匹配的固定预算持平。  

第2节 (https://arxiv.org/html/2606.15474#S2) 将这些贡献置于背景中;第3节 (https://arxiv.org/html/2606.15474#S3) 构建预算限制的主监控器;第4节 (https://arxiv.org/html/2606.15474#S4) 添加锚点构造及其保证;第5节 (https://arxiv.org/html/2606.15474#S5) 在两个数据集和两个真实裁判变化上验证所有内容,然后第6节 (https://arxiv.org/html/2606.15474#S6) 讨论局限性。  

## 2 相关工作  

#### 预测驱动推断和任意时刻有效测试。  

预测驱动推断(Angelopoulos等,2023 (https://arxiv.org/html/2606.15474#bib.bib1),2024 (https://arxiv.org/html/2606.15474#bib.bib2))使用廉价预测器对少量昂贵标签进行去偏,并已被扩展到许多方向:交叉拟合(Zrnic和Candès,2024 (https://arxiv.org/html/2606.15474#bib.bib28))、频率学派辅助贝叶斯构造(Kilian等,2025 (https://arxiv.org/html/2606.15474#bib.bib14))、联邦和装袋变体(Cortinovis和Caron,2025 (https://arxiv.org/html/2606.15474#bib.bib6))、共形程序(Csillag等,2025a (https://arxiv.org/html/2606.15474#bib.bib7))以及功效分析(Chen等,2026 (https://arxiv.org/html/2606.15474#bib.bib4))。我们的主监控器建立在Csillag等(2025b (https://arxiv.org/html/2606.15474#bib.bib8))的*预测驱动e值*上,其定理2.1被我们的每层过程继承,并置于更广泛的任意时刻有效传统中:测试(超)鞅和Ville不等式(Ville,1939 (https://arxiv.org/html/2606.15474#bib.bib22))、时间一致集中(Howard等,2025 (https://arxiv.org/html/2606.15474#bib.bib13),2022 (https://arxiv.org/html/2606.15474#bib.bib12))、赌注置信序列(Waudby-Smith和Ramdas,2022 (https://arxiv.org/html/2606.15474#bib.bib24))、用于顺序变化的e检测器(Shin等,2023 (https://arxiv.org/html/2606.15474#bib.bib19))、预测器的顺序比较(Choe和Ramdas,2023 (https://arxiv.org/html/2606.15474#bib.bib5))以及部署模型的预测驱动*风险*监控(Zhang等,2026 (https://arxiv.org/html/2606.15474#bib.bib26))。我们在此不声称新的有效性理论:廉价代理PPI估计器、任意时刻有效e过程和漂移检测的组合已存在于这个簇中。我们第3节 (https://arxiv.org/html/2606.15474#S3) 的贡献是特定的组装——一个每(评分维度×层)Bonferroni e过程用于*局部盲区*漂移,加上一个e财富升级触发——在单一成本与延迟前沿上针对此簇进行基准测试。真正的新材料是第4节 (https://arxiv.org/html/2606.15474#S4) 的锚点构造和归因分析。  

#### 主动和自适应获取。  

几条研究线将采样规则与下游推断或检测目标结合起来:主动推断在不确定性最高处进行标记(Zrnic和Candès,2026 (https://arxiv.org/html/2606.15474#bib.bib29))、Csillag等附录B.2中的主动获取规则(我们将其作为基线包含)、轮询主动变化检测(Chaudhuri等,2024 (https://arxiv.org/html/2606.15474#bib.bib3))、自适应采样变化检测(Yi和Yang,2025 (https://arxiv.org/html/2606.15474#bib.bib25))以及将检测器与获取策略配对的漂移到行动控制器(Lamaakal等,2026 (https://arxiv.org/html/2606.15474#bib.bib15))。一个警示性结果框架了我们的升级发现:Sfyraki和Wang(2026 (https://arxiv.org/html/2606.15474#bib.bib18))证明,对于预测驱动均值估计,不确定性驱动的自适应采样渐近上并不比固定预算更好。我们的结果*与他们一致*——我们的e财富触发在最微弱的漂移上仅与匹配的固定预算持平——而我们的主张狭隘地关于相对于其他自适应*触发器*的成本效率(协变量驱动规则在偏倚的廉价裁判下浪费预算或无效读取),而非渐近优于固定τ。  

#### LLM作为裁判的可靠性。  

日益增长的文献研究LLM裁判的可靠性(Zheng等,2023 (https://arxiv.org/html/2606.15474#bib.bib27)):正确报告使用不完美裁判获得的结果(Lee等,2026 (https://arxiv.org/html/2606.15474#bib.bib16))、在噪声裁判标签下进行有效的下游推断(Feng等,2026 (https://arxiv.org/html/2606.15474#bib.bib9))以及量化裁判偏差和不确定性(Fiedler,2026 (https://arxiv.org/html/2606.15474#bib.bib10))。这些工作纠正或限定了*静态*裁判——它将裁判的错误视为固定的(尽管未知)扭曲来去偏。我们处理一个不同的失败模式:一个行为*随时间变化*的裁判,以及将这些变化与正在评估的系统变化分开的问题。据我们所知,没有先前工作专门运行一个人工锚定的e过程来检测和归因裁判身份的漂移。  

## 3 成本感知监控:预算限制的强裁判  

### 3.1 流模型  

一个部署产生项目i=1,2,...按流式到达。每个项目在R个评分维度上被评分,每个分数归一化到[0,1],并带有一个可观测的分层标签t∈{1,...,K}(这里是一个主题)。两个裁判可用。一个*廉价*裁判μ在*每个*项目上运行并返回一个向量μi∈[0,1]^R;一个*强*裁判y返回yi∈[0,1]^R但昂贵,因此仅在预算下对采样子集进行查询。在本节中,y是可信的参考:y的下降(按假设)是真正的质量下降。  

### 3.2 每层预测驱动e过程  

监控器为每个(评分维度×层)单元维护一个e过程,测试单侧零假设:单元均值未低于健康基准线,
\[
H_0^{\mathrm{sys}}: \quad \mathbb{E}[y_i[r] \mid i\in\text{cell}(r,t)] \;\geq\; q_0[r,t]-0.05,
\tag{1}
\]
其中每单元的基准线q0[r,t]是层t受控项目上强裁判分数的均值,从保留的校准数据中估计一次,0.05的松弛量吸收校准噪声。每个单元通过预测驱动e值(Csillag等,2025b (https://arxiv.org/html/2606.15474#bib.bib8))积累财富:廉价分数μi[r]提供去偏预测,而在采样项目上强标签对其进行校正,因此少量的强查询即可产生有效的e值,同时利用廉价裁判作为免费辅助信息(Angelopoulos等,2023 (https://arxiv.org/html/2606.15474#bib.bib1))。赌注是*可预测的*——从过去选择——并限制在有效λ_max(π_i),该值仅依赖于(可预测的)采样概率π_i,这使得每个单元的财富在方程1 (https://arxiv.org/html/2606.15474#S3.E1)下成为非负超鞅。当任何单元的财富越过Bonferroni阈值RK/α_sys时,告警触发。有效性继承自Csillag等(2025b (https://arxiv.org/html/2606.15474#bib.bib8),定理2.1)结合π的可预测性和Ville不等式(Ville,1939 (https://arxiv.org/html/2606.15474#bib.bib22)):该族在任意数据依赖停止时间上曾经虚警的概率最多为α_sys。每层设计并非改进而是必要性。局部盲区漂移——局限于一个单元的质量回归,在廉价裁判视而不见的评分维度上——是

相似文章

换一个裁判,分数就变了:审计大模型作为裁判的可靠性

arXiv cs.CL

本文审计了大模型作为裁判(LLM-as-judge)评估的可靠性,表明即使候选回复固定不变,更换评估模型也可能改变评分。论文考察了Qwen3和MiniMax模型的扩展与升级路径,得出结论:裁判升级不可互换,并提出了最佳报告实践。

评判电路

arXiv cs.CL

本文研究了LLM-as-a-judge的内部机制,发现模型在中期到后期的多层感知机(MLP)中共享一个稀疏的潜在评估器子图,该子图处理抽象评判,而格式特定的终端分支将评判映射到输出令牌,揭示了格式导致的不一致性的原因。