LLM评审小组的停止与路由策略
摘要
本文介绍了一种优化LLM评审小组的方法,通过将评委分类为副本、补充或专家,并使用基于角色的分配策略,根据验证增益阈值高效地路由和停止评估。
arXiv:2608.19802v1 公告类型:新
摘要:LLM评估管道通常有许多候选评委:通用LLM-as-a-judge提示、奖励模型、安全分类器、置信度变体和任务特定验证器。部署问题不仅是哪个评委最好,还涉及应该在哪些样本上调用哪些评委,以及何时停止面板构建。我们将评委面板设计构建为一个基于角色的分配问题。从一个小的有标签审计集、声明的切片和评委成本中,该方法估计目标相对角色:副本不添加条件信息,补充改进全局面板,专家仅在特定切片上提供帮助。这些角色引出一个策略:丢弃副本,全局添加补充,有条件地路由专家,当验证增益低于阈值时停止。在推理、代码、安全、偏好、奖励模型、摘要和数学审计中,该方法与单一评委、平面面板、匹配多样性启发式方法、全调用堆叠、可靠性陪审团和节俭级联进行比较。结果是评委调用的制度图:在可部署切片上路由专家,在饱和验证器状态下停止,当风险收益值得时保持广泛集成,忽略条件副本。输出是为下一批评估可重用、可审计的调用计划。
查看缓存全文
缓存时间: 2026/08/21 10:12
# LLM评判面板的停止与路由策略 来源:https://arxiv.org/html/2608.19802 Yi Xie、Yanghui Rao *致谢:通讯作者* *所属单位:计算机科学与工程学院* *所属单位:中山大学(广州,中国)* *邮箱:[email protected]、[email protected]* *[[email protected]](mailto:[email protected])* ###### 摘要 LLM评估流程通常包含多种候选评判器:通用LLM作为评判器的提示、奖励模型、安全分类器、置信度变体以及任务专用验证器。部署问题不仅在于哪个评判器最佳,还在于应对哪些样本调用哪些评判器,以及何时应停止构建面板。我们将评判面板设计建模为一种基于角色的分配问题。基于小型标注审计集、预定义切片和评判器成本,该方法估算相对于目标的角色:**副本**不提供条件信息,**补充者**可提升全局面板性能,**专家**仅在特定切片上提供帮助。这些角色衍生出一种策略:丢弃副本、全局添加补充者、按条件路由专家,并在验证增益低于阈值时停止。在推理、代码、安全、偏好、奖励模型、摘要和数学审计中,该方法与单一评判器、平坦面板、匹配多样性启发式、全量调用堆叠、可靠性陪审团和节俭级联进行了比较。结果形成了一份评判器调用的区域图谱:在可部署切片上路由专家、在验证器饱和时停止、在风险收益合理时保留广泛集成、忽略条件副本。输出是为下一批评估生成的可复用、可审计的调用计划。 ## 1 引言 LLM作为评判器的系统现已广泛应用于模型评估(45、30、46、22、40、23、15、6)。一个实际的评估流程可能包含通用评判器、评分提示、奖励模型、安全分类器、置信度变体和确定性验证器。对于每一批新的评估,研究者必须做出具体的操作决策:调用整个面板、调用廉价验证器后停止、仅对风险案例路由安全评判器,或完全剔除冗余提示。静态评判器排序无法回答这一问题,因为评判器的价值取决于当前面板、目标分布及其实际应用的样本切片。这创造了一个有用的契机:一个小型标注审计集可以将评判器多样性从描述性属性转化为调用策略。安全评判器可成为越狱失败的专家;验证器可使多个LLM评判器变得冗余;而在广泛的数学或奖励模型场景中,完整集成仍可能是最优选择(43、5)。目标是在为下一批数据支付评判器调用成本之前识别这些场景。我们将**副本**、**补充者**和**专家**的分类转化为一种分配方法,输出包含基于验证的停止记录的调用策略 π(x)⊆J。该方法评估每个候选者在当前面板条件下的校准风险降低能力,并判断该增益是全局性还是切片特定的。副本将被丢弃,广泛补充者将被加入全局面板,专家将路由至其切片,当剩余候选者均未超过预设增益阈值时停止构建。 #### 主要贡献。我们提出三点主张:第一,评判器多样性应相对于目标且具有条件性,而非名义上的;第二,副本/补充者/专家角色可转化为包含成本、切片和停止条件的实用策略;第三,该方法的实证价值体现在部署区域图谱:它明确了何时路由专家、何时保留廉价停止面板、何时在验证器后停止,以及何时为完整面板付费。 ## 2 基于角色的分配 设 X 为被评估项,Y∈[0,1] 为审计标签。有限候选池 J 包含评判器信号 Zⱼ(如正确/错误、安全/不安全或A/B)。对于面板 S⊆J,设 Z_S 为联合输出模式。研究者声明与目标分布相关的切片 F(如 LLMBar 子集、安全故障模式、生成器类型或难度级别)。目标是确定策略 π(x; J, F)⊆J,以决定对样本 x 调用哪些评判器。固定目标分布 P,对于面板 S,定义神谕预测器 η_{P,S}(z)=E_P[Y|Z_S=z] 及其平方损失神谕风险 R*_{P,S}=E_P[(Y−η_{P,S}(Z_S))²]。添加评判器 j∉S 的条件价值为 g_P(j|S)=R*_{P,S}−R*_{P,S∪{j}},即 j 中未被 S 覆盖的目标信息。 ###### 引理1(投影增益恒等式) 对任意有限面板 S 和候选评判器 j∉S,有 g_P(j|S)=E_P[(η_{P,S∪{j}}(Z_{S∪{j}})−η_{P,S}(Z_S))²]≥0。该恒等式无需评判器间的独立性假设。 对于切片 f∈F,定义广义增益 C_P(j|S)=g_P(j|S) 和切片增益 A_f(j|S)=g_{P_f}(j|S)。角色画像 profile_{P,F,S}(j)=(C_P, {A_f}_{f∈F}) 是多标签的:一个评判器可能同时是广义补充者和切片专家,其角色可能因新评判器加入面板而改变。该画像被设计为操作接口而非命名方案。例如,一个单独使用时较弱的奖励模型评判器,在加入评分提示后可能成为补充者,因为它能区分提示所混淆的案例;反之,同一模型家族的第二个提示在第一个提示存在时可能变为副本。切片角色以相同相对于目标的方式评估。我们还追踪诊断性专业化比率 ρ_f(j|S)=g_{P_f}(j|S)/(g_P(j|S)+ε₀)(ε₀>0仅避免除零)。该比率不排斥角色互斥,而是标记价值集中度。一个评判器可能既是广义补充者,又在特定切片上值得特别关注。 **构建规则**:我们将每个审计集分为构建拟合集、构建验证集和最终测试集。模式校准器通过拟合集上规范化联合评判器输出模式的单元均值估计 η_{P,S};未见的验证或测试模式则回退至拟合集标签均值。选择仅使用验证集增益;报告结果仅使用最终测试集。给定当前全局面板 S、成本 cⱼ 和阈值 τ_P,仅当 max_{j∈J\S}[ĝ^val_P(j|S)−λcⱼ]>τ_P 时添加全局评判器。对于每个切片,仅当 max_{j∈J\(S∪S_f)}[ĝ^val_{P_f}(j|S∪S_f)−λ_f cⱼ]>τ_f 时添加路由专家。部署策略对切片 f(x) 中的样本调用 π(x)=S∪S_f(x),否则调用 S。部署中使用的切片函数必须在路由评判器调用前可计算。真实标签可用于分析审计层次,但不能作为新样本 π(x) 的有效输入;可部署路由必须使用元数据、验证器输出、分类器输出或已观测到的评判器分歧。若无候选者超过阈值,策略停止并记录基于验证的停止报告,表明所有未使用的广义或切片增益均低于声明阈值。该报告是操作性而非渐近性的:它表明在审计划分和成本模型下,面板无需进一步评判器调用即可使用。 算法上,全局构建是贪心验证过程。从空面板或用户预置面板开始,我们拟合当前模式校准器,为每个未使用候选者计算成本调整后的验证增益,仅当最佳候选者超过 τ_P 时添加,然后重复。全局面板停止后,每个切片固定已选全局面板执行相同贪心搜索。最终策略在完整构建集上重新拟合,并在保留的最终测试样本上评估一次。停止报告是未使用的广义和路由候选者未通过不等式的集合,记录部署策略的实际决策:在有限审计划分、声明切片、阈值和成本下,无剩余单评判器调用值得加入当前计划。若部署者希望搜索成对或高阶互补性,可使用波束或子集提议运行相同验证增益目标;停止报告将记录扩展的搜索空间。这种有限划分设计使策略可作为部署审计工具:评判器选择基于构建数据,最终测试样本保留用于报告,比较包括廉价基线和全量调用聚合端点。预期用途很简单:在未来支付评判器调用成本前,使用标注审计集决定候选者是否能为实际调用的面板提供条件性信息增益。 ## 3 实验协议 我们评估非饱和设置,即单一评判器尚未达到完美性能的场景:困难的 GSM8K 推理审计、MBPP 公共测试过拟合审计、JailbreakBench 安全审计、基于 DeepSeek、Qwen3 和 JudgeLM 锚点的 LLMBar 偏好审计、RewardBench、Arena100K、SummEval 和 MATH-500。HumanEval 和普通 GSM8K 仅作为饱和停止检查。具体候选池包括 Qwen2.5 Instruct 7B、Llama 3.1 Instruct 8B、Mistral v0.3 7B、Prometheus 2 v2.0 7B、Gemma 3 IT 12B、Atla Selene Mini (Llama 3.1, 8B) 和 DeepSeek V4 Flash API 模型(总参数 284B,激活参数 13B),部分任务使用特定子集。LLM 评判器调用标准化成本为 1.0,确定性验证器成本为 0.1。路由键视为预可用的元数据、验证器输出、分类器输出或已观测评判器信号;获取路由键所需的额外模型调用需计入成本模型。基线涵盖实践者可能采用的选项:单最佳验证评判器、平坦全评判器面板、匹配 K-top-K、相关性多样性和质量多样性面板、全量调用岭/逻辑堆叠、Dawid–Skene 式可靠性陪审团,以及 FrugalGPT/RouteLLM 式置信度级联。所有结果取 10 次随机划分的平均值;附录 E 报告了主要风险对比的划分标准差和 95% 置信区间。除非另有说明,τ_P=τ_f=0.005。附录 C 列出了各设置使用的评判器池、路由键和廉价验证器。 **评估指标**:对所有任务使用保留集平方校准风险,标签为二分类时使用准确率。风险是主要指标,因为方法通过校准条件增益选择评判器;报告准确率是为了使标准正确性、安全和偏好审计结果更易读(18)。报告平均成本和平均评判器调用次数,因为本文目标是部署策略而非无约束聚合器。数据集选择旨在防止单一现象解释所有结果。困难 GSM8K 推理和 MBPP 公共测试过拟合用于测试廉价验证器与少量 LLM 评判器的组合是否可避免默认全量调用。LLMBar 测试自然和对抗子集上的可部署条件路由,而 JBB 测试安全价值是否集中在可部署分类器或分歧代理以及人类标签审计层次上。人类标签仅用于审计评估,而非部署时路由。Arena100K 和 SummEval 测试非饱和设置中的停止,其中额外评判器可能损害校准。RewardBench 和 MATH-500 是边界案例,广泛聚合可能仍有吸引力。HumanEval 和普通 GSM8K 是饱和健全性检查:当客观验证器解决审计目标时,正确策略行动是停止。基线按部署需求同样分离。
相似文章
评判电路
本文研究了LLM-as-a-judge的内部机制,发现模型在中期到后期的多层感知机(MLP)中共享一个稀疏的潜在评估器子图,该子图处理抽象评判,而格式特定的终端分支将评判映射到输出令牌,揭示了格式导致的不一致性的原因。
判断、检索或放弃:具有可证明风险保证的不确定性防护LLM判断
本文提出一个风险控制框架,用于在事实评估中将LLM作为判断器。该框架校准不确定性阈值以维持用户指定的错误率,并在必要时路由到检索增强模式,从而实现具有可证明可靠性保证的更高覆盖率。
RoPoLL: 鲁棒的LLM评审团面板
本文提出了RoPoLL,一种鲁棒的LLM评审团面板,用几何中位数聚合替代标准平均,以处理个别评审的偏见污染,相比标准PoLL提供了理论保证和实证优势。
法官代码化:通过程序蒸馏实现可扩展评估
本文介绍了PAJAMA,这是一个将大语言模型作为评判者的决策逻辑蒸馏到程序化评判者中的系统,消除了每次样本的API成本,同时匹配了13B大语言模型评判者的性能,并为可扩展评估提供了透明度和效率改进。
RankJudge:一个多轮LLM-as-a-Judge合成基准生成器
RankJudge是一个基准生成器,它创建带有注入缺陷的配对多轮对话,用于评估LLM评判者在复杂对话中正确识别更好和更差回复的能力。