能力,而非准确性:技能优化中无参考评判门的诊断
摘要
本文提出一个诊断框架,用于评估LLM-judge能否在无参考验证器的情况下有效评估优化任务中的候选技能,重点在于能力和可区分性指标。
查看缓存全文
缓存时间: 2026/08/20 10:19
# 1 引言 来源:https://arxiv.org/html/2608.18719 能力而非准确率:技能优化中无参考评判门的诊断 陈乐1魏洋波2姚超3卢少强2钱俊宏4吴晨4何磊4 1加州大学洛杉矶分校 2上海交通大学 3亚利桑那州立大学 4东方理工大学(宁波) [email protected] 摘要 文本空间技能优化通过演化自然语言技能文档来调整冻结的智能体,并通过验证门接受每个候选方案。现有门依赖于*可验证*奖励,将这些方法限制在具有自动验证器的任务中。用*LLM评判门*替换验证器将解除这一限制,但此类评判门是否携带可用信号尚未经检验。我们提出一个前置问题:在将评判器置入循环之前,我们能否判断其评分是否至少能区分正确与错误答案?我们将无参考评判器形式化为*潜在求解器*——其判断基于与其自身结论的一致性,因此其评估能力受限于其求解能力。该模型得出了判别力(ROC-AUC)相对于评判器能力\(c\)和答案空间大小\(k\)的闭式界,一个必要条件\(c > 1/k\),以及一个结论:边际AUC受项目难度混淆,而问题内估计量则不会。一个*非介入式*探针在真实的优化运行中记录评判器评分,而不改变任何决策。我们发现,在能力接近下限时,判别力处于随机水平;高于此限时则可用;评判器的基准准确率高估了重要的能力;并且在一项闭环研究中,该筛选器能预测*哪种*门控错误会发生。结果是针对评判门的一个低成本的部署前诊断。 ## 1 引言 请参见图例 图1:\(1\) 验证门拥有标准答案,因此只有正确的候选方案能通过。\(2\) 无参考评判器没有标准答案,实际上必须重新求解每个项目以进行评分,因此一旦其能力\(c\)接近随机下限\(1/k\),其评分就接近随机。\(3\) 因此,我们在部署前测量能力和判别力,筛除未超过下限的评判器——这是必要条件,但非充分条件。近期的工作通过演化紧凑的、自然语言的*技能*文档,而非更新权重,来调整冻结的语言模型智能体以适应新领域\[16 (https://arxiv.org/html/2608.18719#bib.bib2), 2 (https://arxiv.org/html/2608.18719#bib.bib1)\]。这些优化器运行一个候选技能,对其进行评分,并使用*验证门*,仅当候选方案能提高保留集上的分数时才保留——这与监督学习中的模型选择直接类似。关键是,门分数来自*可验证*信号:与标准答案的精确匹配,或可执行检查。当存在这样的验证器时,这效果很好,但它将该范式限制在可验证任务中。图1 (https://arxiv.org/html/2608.18719#S1.F1)总结了问题及我们的回应。解除该限制的长远动机是开放式生成——写作、对话、设计原理——但我们首先声明,本研究并未涉及那么远。我们的模型和测量都需要单一的标准答案和验证器标签,因此研究的任务都是客观可检查的;将此诊断扩展到真正的开放式任务(其中正确性非二元,答案空间无自然大小,判断基于评分标准而非一致性)是未来的工作。我们现在能做的是在真实数据可供审计的任务上回答这个前提性问题。 一种自然的解除限制的方法是将验证门替换为*LLM评判门*:通过评判模型对其输出的评分来评判每个候选技能,并根据评判器的偏好接受。在强化学习中,基于评判的信号已将优化扩展到可验证奖励之外\[3 (https://arxiv.org/html/2608.18719#bib.bib9)\],但始终在*权重空间*中;它们尚未被引入文本空间技能优化,其中权重是冻结的,优化对象是一个持久的文档。此外,评判器的可靠性无法保证:已知评判器存在偏差且可被操纵,将评判器耦合到接受循环会产生选择压力,可能放大奖励黑客攻击\[19 (https://arxiv.org/html/2608.18719#bib.bib3)\]。 本文在部署任何评判门之前提出一个必须回答的问题:评判门何时可以替代验证门,何时会失败?我们不直接替换门并寄希望于其有效,而是采取*诊断*方法。我们在现有优化器的门上设置一个评判探针,对每个候选方案进行评分,但*不影响任何接受/拒绝决策*,保持优化动态不变。这使我们能够在真实运行中测量评判信号是否可信——操作化为*判别力*:评判器评分能否将验证器标记为正确的答案与标记为错误的答案区分开(ROC-AUC)? 我们的发现有三点。\((i)\) 评判器判别力在不同任务间差异显著——在研究数学上处于随机水平,在事实问答和研究生科学上则可用——因此评判信号不能被假定。\((ii)\) 当评判器自身能力接近随机下限时,如模型所预测的那样,判别力崩溃;并且只要能在没有难度混淆的情况下进行测试,闭式界就成立。\((iii)\) 评判器的标称基准准确率对此测试来说是乐观的输入:将差距分解为真实能力时,显示审查惯例、基准暴露以及求解/评分情境差距都各自贡献,且方向一致。 #### 贡献。 \(1\) 理论。我们将无参考评判器建模为潜在求解器,并推导出判别力相对于其能力\(c\)和答案空间大小\(k\)的闭式界,这是任何判别的*必要但非充分*条件\(c > 1/k\),以及一个识别结果:边际AUC受项目难度混淆——一个仅读取难度而从不读取答案的评判器可以得分高于随机——而问题内估计量对此不变。\((2)\) 测量。我们提供了一个非介入式探针,在真实的优化运行中记录评判信号而不改变接受状态,以及一个可重用的协议——情节级评分、答案内容馈送、带问题聚类自助法的问题内分层、以及基于代理的去污染——用于在部署前审计候选评判门。\((3)\) 发现。在能力接近下限时,判别力崩溃至随机水平,且预测的界在可清晰测试之处成立;评判器的标称基准准确率高估了能力,我们使用具有正交误差来源的估计器分解了三个可分离的原因;并且在一项闭环研究中,该筛选器能预测*哪种*门控错误发生——未通过的评判器会引入退化,而通过的评判器则不会,且仅通过过度拒绝出错。 ## 2 相关工作 #### 自演化智能体技能。 一个快速发展的研究领域为冻结的智能体配备可重用、自然语言的技能\[17 (https://arxiv.org/html/2608.18719#bib.bib19)\]并自动优化它们:从执行轨迹中离线蒸馏\[8 (https://arxiv.org/html/2608.18719#bib.bib10), 13 (https://arxiv.org/html/2608.18719#bib.bib11)\],以及通过故障驱动反思在线演化\[2 (https://arxiv.org/html/2608.18719#bib.bib1)\]、验证门更新\[16 (https://arxiv.org/html/2608.18719#bib.bib2)\]、与验证器的对抗协同演化\[18 (https://arxiv.org/html/2608.18719#bib.bib12)\]、共享资产层\[7 (https://arxiv.org/html/2608.18719#bib.bib13)\]、信用信号\[12 (https://arxiv.org/html/2608.18719#bib.bib14)\]、基于技能库的强化学习\[15 (https://arxiv.org/html/2608.18719#bib.bib15)\]以及技能-工具协同演化\[14 (https://arxiv.org/html/2608.2608.18719#bib.bib16)\];反思性文本演化甚至在样本效率上优于标量奖励RL\[1 (https://arxiv.org/html/2608.18719#bib.bib17)\]。尽管它们各不相同,但这些系统共享一个承诺:接受决定基于*可验证*信号——精确匹配、可执行检查或程序化评分器。我们的工作针对这一共同假设,并询问评判器能否替代验证器,以及在何种条件下可以。 #### 已位于评估循环中的评判器。 假设并非评判器在此场景中缺席,而是凡出现之处,它们都是*基于参考*的。SealQA\[10 (https://arxiv.org/html/2608.18719#bib.bib18)\],一个在技能演化文献中广泛使用的基准,由一个冻结的评判模型评分,该模型接收问题、标准答案和智能体响应,然后返回二元判断。提供标准答案将判断转化为比较任务,回避了我们研究的问题。我们关注的是评判门必然占据的*无参考*情形:在优化期间,被评估的候选方案没有标准答案,因此评判器必须自己提供标准。 #### 无奖励和基于评判的优化。 在RL后训练中,LLM评判器在无法提供可验证奖励的地方提供学习信号,例如通过排列轨迹\[3 (https://arxiv.org/html/2608.18719#bib.bib9)\]或结合偏好、评判和程序化信号来抑制奖励黑客攻击\[9 (https://arxiv.org/html/2608.18719#bib.bib5)\]。这项工作在权重空间中进行,并假设评判器提供可用信号;它没有描述该假设何时成立。我们将评判信号的想法转置到冻结权重、文本空间技能优化中,并将评判器的可信度作为研究对象。 #### LLM作为评判器的可靠性。 LLM评判器表现出系统性偏差且可被操纵\[19 (https://arxiv.org/html/2608.18719#bib.bib3)\]。我们增加了一个任务相关的维度:评判器*评估*答案的能力受限于其*求解*这些答案的能力,而这一界限——而非通用偏差——解释了评判门在何处失效。 ## 3 方法 请参见图例 图2:概述。技能优化(\(2\))仍由验证器控制:仅当其验证器分数提高时,\(\pi'\)才被接受,而目标权重保持冻结。非介入式探针(\(3\))为每个情节记录\((s_i, y_i)\)而不影响接受状态,产生\(\mathcal{D} = \{(s_i, y_i)\}\)。离线诊断(\(4\))使用问题聚类自助法估计问题内AUC、闭卷能力,以及审查、暴露和求解/评分差距的影响。部署筛选器(\(5\))排除评判门,除非能力超过随机下限——这是必要但非充分条件。图2 (https://arxiv.org/html/2608.18719#S3.F2)给出了整体流程。评判器的裁决从何处获取信息,如果它无法看到标准答案?我们的起点是一个最小假设:无参考评判器没有独立于其自身求解能力的真值来源,因此评估在信息上退化为一种隐式的重新求解——*要评分,首先必须能够回答*。我们首先设置*评判器作为潜在求解器*模型,然后推导ROC-AUC与能力之间的闭式关系及其可测试的预测,最后呈现相应的测量工具——非介入式探针、情节级估计和能力测量。 ### 3.1 设置和模型假设 考虑一个任务,其答案空间大小为\(k \geq 2\)(四选一MCQ给出\(k=4\);自由文本是极限\(k \to \infty\)),标准答案为\(a^*\)。一个*情节*包含优化系统产生的候选答案\(a\)及其验证器标签\(y = \mathbb{1}[a = a^*] \in \{0, 1\}\)。在无法访问\(a^*\)的情况下,评判器为(问题,\(a\))这一对发出一个分数\(s\)。记\(S_1, S_0\)为分别在\(y=1\)和\(y=0\)条件下抽样的分数,判别力定义为\(\mathrm{AUC} := \Pr(S_1 > S_0) + \frac{1}{2} \Pr(S_1 = S_0)\),即随机正负对被正确排序的曼-惠特尼概率。 我们用三个假设来建模无参考评判器。\((A1)\) 隐式重求解:评判器形成一个内部解\(\hat{a}\),条件独立于\(a\),且\(\Pr(\hat{a} = a^*) = c\),其中\(c \in [0, 1]\)是其在评分情境中的*能力*。\((A2)\) 误差离散化:在\(\{\hat{a} \neq a^*\}\)上,\(\hat{a}\)在其余\(k-1\)个答案上均匀分布。\((A3)\) 一致性评分:\(s = \mathbb{1}[a = \hat{a}]\)。该模型遵循达维德-斯凯恩噪声标注者模型\[4 (https://arxiv.org/html/2608.18719#bib.bib8)\]的传统,区别在于标注者的混淆结构被实现为一个显式的重求解过程,这使得能力\(c\)可以通过闭卷自解准确率单独测量。 #### 模型的范围。 \((A1)\) 并未断言验证普遍与生成一样困难。在有评分标准或外部证据提供不依赖于解决方案的标准,或者廉价的局部检查足够的地方——单位、边界条件、所提供证明的一步——验证更容易,且\((A1)\)低估了评判器。因此,我们将模型范围限定在*无评分标准或外部证据的单答案任务*,其中裁决基于候选方案与评判器自身结论之间的一致性。在该范围内,\((A1)\)是可证伪的:它预测当\(c \to 1/k\)时坍缩至随机水平,我们的实验对此进行了测试。基于评分标准和基于证据的判断是自然的扩展。 ### 3.2 判别力的解析表征 命题1。*在 \((A1)–(A3)\) 下,* \[ \mathrm{AUC} = \frac{1}{2}\left(1 + c - \frac{1 - c}{k - 1}\right) = \frac{1}{2} + \frac{c k - 1}{2(k - 1)}. \] (1) *证明梗概。* 当\(y=1\)时,\(a = a^*\),所以真阳性率\(\mathrm{TPR} = \Pr(\hat{a} = a^*) = c\)。当\(y=0\)时,事件\(\{\hat{a} = a\}\)蕴含\(\{\hat{a} \neq a^*\}\),因此根据\((A1)–(A2)\),假阳性率\(\mathrm{FPR} = (1 - c)/(k - 1)\)。对于二元分数,\(\mathrm{AUC} = \frac{1}{2}(1 + \mathrm{TPR} - \mathrm{FPR})\);代入得到\((1\) (https://arxiv.org/html/2608.18719#S3.E1)\))。\(\square\) 公式\((1\) (https://arxiv.org/html/2608.18719#S3.E1)\)展现出一种阈值结构:\(\mathrm{AUC} - \frac{1}{2}\)与\(ck - 1\)同号。两个结果表明该阈值对现实的偏离是鲁棒的,而闭式值应被读作一个*上界*。 引理1(噪声使AUC趋向随机)。\(令s' = s + \varepsilon\),其中\(\varepsilon\)独立同分布,独立于\((s, y)\),且连续分布。则\(\mathrm{AUC}' - \frac{1}{2} = (\mathrm{AUC} - \frac{1}{2})(2q - 1)\),其中\(q := \Pr(Z < 1) \in (\frac{1}{2}, 1]\),\(Z := \varepsilon_0 - \varepsilon_1\)。因此噪声以一个属于\((0, 1]\)的因子将AUC向\(\frac{1}{2}\)收缩,而不改变其相对于\(\frac{1}{2}\)的符号。 注记1(合谋与上界性)。将\((A1)–(A2)\)放宽至仅指定*合谋率*\(\rho := \Pr(\hat{a} = a \mid y = 0)\)得到\(\mathrm{AUC} = \frac{1}{2}(1 + c - \rho)\),它关于\(\rho\)严格递减。\((A1)–(A2)\)对应于\(\rho = (1 - c)/(k - 1)\)。当评判器和被评估模型以相关的方式出错——都被同一干扰项吸引,这在共享训练分布的模型中很典型——\(\rho\)会超过该值,因此在fi
相似文章
SkillTV-Bench:评估裁判在技能增强型智能体执行中的表现基准
介绍SkillTV-Bench,一个包含681个案例的基准,用于评估LLM智能体中技能感知的轨迹验证,以及SkillTV-Evolve,一种将验证知识外部化为可复用JudgeSkill的方法,将裁判准确率提升14.8个百分点。
盲人策展人:有偏见的评委如何悄无声息地禁用自进化代理中的技能退出机制
本文研究有偏见的LLM评委如何悄无声息地禁用自进化代理中的技能退出机制,表明跨越尖锐阈值的假阳性偏差阻止了基于贡献的退出,且该失败跨领域普遍存在,只能通过缺陷注入审计检测到。
When the Judge Should Not Decide: Evidence-Locked, Non-Compensatory Selection Bounds LLM-Judge Failure in Reasoning Pipelines
This paper shows that LLM judges embedded in reasoning pipelines often make poor decisions, and proposes Evidence-Locked Derive–Gate–Repair (EL-DGR) to constrain judge overrides with evidence certificates, improving accuracy over majority vote and first-candidate baselines.
更令人信服,而非更正确:无参考LLM评判者的自我博弈奖励操纵
本文识别了自我博弈训练中使用的无参考LLM评判者的结构缺陷,表明它们评估的是合理性而非正确性,导致奖励操纵,策略学会生成合理但错误的答案。作者提出了一种隐藏锚点审计和解锚奖励来缓解这一问题。
XLGoBench: 通过算法任务检测跨语言技能差距
XLGoBench 引入了一个合成算法任务基准,用于检测大语言模型中的跨语言技能差距,并在多个先进模型中展示了持续的差距。