SESSE: 草图、扩展、排序、总结、评估 -- 通过结构化分解的LLM-as-Judge评估
摘要
SESSE是一个无需训练的框架,将整体性的LLM-as-Judge评估分解为结构化子问题,从而提高可解释性并诊断标签模糊性,同时与微调模型达到竞争性的性能。
arXiv:2608.18303v1 公告类型:新
摘要:LLM-as-judge评估将响应质量评估简化为单个整体性的A/B偏好选择,无法孤立出哪些质量维度驱动了偏好,也无法区分模型错误与真实的标签模糊性。我们提出SESSE(草图、扩展、排序、总结、评估),这是一个无需训练的框架,将整体判断分解为直接从法官自身错误案例中挖掘的结构化子问题;不需要预言响应、特定任务标准或微调。在RewardBench(n=1,000)上,SESSE实现了与链式思考基线的接近持平,并与微调专家RISE-Judge-32B(92.7%)竞争,同时完全无需训练。每个标准的投票证据提供了可解释的审计轨迹,用于诊断标签模糊性和法官失败模式,这在单个整体输出令牌中是不可用的。
查看缓存全文
缓存时间: 2026/08/20 10:07
# 草拟、扩展、排序、总结、评估:基于结构化分解的LLM-as-Judge评估 来源:https://arxiv.org/html/2608.18303 ###### 摘要 LLM-as-judge评估将响应质量评估简化为单一的整体A/B偏好选择,无法隔离哪些质量维度导致了该偏好,也无法区分模型错误与真实的标签歧义。我们提出SESSE(草拟、扩展、排序、总结、评估),这是一种无需训练的框架,它将整体判断分解为结构化的子问题,这些问题直接从评审者自身的错误案例中挖掘得出——无需提供参考响应、特定任务的评分标准或微调。在RewardBench(n=1,000)上,SESSE达到了与思维链基线相当的水平,并且与RISE-Judge-32B(92.7%)——一个经过微调的专家模型——具有竞争力,同时保持完全无需训练。按标准提供的投票证据为诊断标签歧义和评审者失败模式提供了可解释的审计跟踪,这是单一的整体输出令牌无法提供的。 ## 1 引言 LLM-as-judge评估已成为可扩展响应质量评估的标准范式——通过MT-Bench20 (https://arxiv.org/html/2608.18303#bib.bib4)、Chatbot Arena1 (https://arxiv.org/html/2608.18303#bib.bib21) 和AlpacaFarm2 (https://arxiv.org/html/2608.18303#bib.bib5) 得以普及——然而它将评估简化为单一的整体A/B偏好选择。即使采用思维链提示,推理也是一次性生成的非结构化自由文本——没有提供机制将质量分解为可审计的维度、隔离驱动偏好的方面或检测系统性的标注噪声。 图1说明:SESSE用结构化分解替代了整体判断——评审标准自动从其自身的错误案例中产生,生成按标准划分的投票证据。现有方法可分为两种范式,各有其关键限制。第一种,基于标准的方法——G-Eval10 (https://arxiv.org/html/2608.18303#bib.bib11)、FActScore11 (https://arxiv.org/html/2608.18303#bib.bib12)、UniEval21 (https://arxiv.org/html/2608.18303#bib.bib19)、CheckList14 (https://arxiv.org/html/2608.18303#bib.bib14)——将质量分解为预定义的维度,但需要手动指定标准或人工设计的评分标准。第二种,训练专家的方法,直接拟合带标签的数据:依赖参考响应的方法如DeCE17 (https://arxiv.org/html/2608.18303#bib.bib17) 和CheckEval8 (https://arxiv.org/html/2608.18303#bib.bib8) 从标准答案中推导标准,而RISE-Judge18 (https://arxiv.org/html/2608.18303#bib.bib15) 及其他微调变体——JudgeLM22 (https://arxiv.org/html/2608.18303#bib.bib20)、Prometheus 26 (https://arxiv.org/html/2608.18303#bib.bib7)、Auto-J9 (https://arxiv.org/html/2608.18303#bib.bib10)——通过SFT+DPO来提高校准度,但代价是需要训练数据和参数更新。SESSE与所有先前工作不同:标准直接从评审者在标准成对标签上的错误分布中产生,无需提供参考响应、任务类型标注或微调。 我们提出SESSE,一个无需训练的框架,用结构化分解替代整体判断。基于开发集上首轮整体运行产生的错误案例驱动了评估标准的自动挖掘。这些标准被聚类成k组,并泛化为一个可复用的A/B/NA(不适用)子问题库。独立的按标准投票生成可解释的审计跟踪和最终偏好;通过位置随机排序缓解位置偏差15 (https://arxiv.org/html/2608.18303#bib.bib16);并将评审者限制为离散令牌A/B/NA,从而比开放式评分19 (https://arxiv.org/html/2608.18303#bib.bib18); 13 (https://arxiv.org/html/2608.18303#bib.bib13) 产生更好的校准度。 分解解决了整体判断核心的可靠性问题:单个输出令牌将所有质量维度混合为一个二元决策,因此两个评审者——或一个评审者在两次运行中——可能不同意,却无法定位原因。相比之下,每个SESSE子问题都是独立可验证的:标注者、第二个模型或同一评审者稍后可以单独重新检查一个A/B/NA投票,而无需重新推导整个整体判断。这反映了为什么清单和评分标准风格的协议比自由形式的人类判断14 (https://arxiv.org/html/2608.18303#bib.bib14) 能提高标注者间一致性:将一个困难的判断分解为许多容易的判断,可以将分歧限制在具体的、可检查的标准上,而不是一个不透明的整体投票。 我们的贡献是:(i)SESSE,一个全自动的5阶段流水线,从评审者错误案例中挖掘评估标准,将它们聚类成可复用的子问题库,并汇总按标准投票——无需参考响应、评分标准或微调;以及(ii)经验证据表明,SESSE在RewardBench上与经过微调的专家评估者具有竞争力,同时提供了整体判断无法获得的按标准诊断证据。 ## 2 方法 图2说明:SESSE流水线:离线库构建(阶段0-4,执行一次)和在线逐样本推理(阶段5)。SESSE作为五阶段流水线运行(图2 (https://arxiv.org/html/2608.18303#S2.F2))。阶段0-1(错误收集,草拟)。阶段0在开发集上整体运行评审者,收集预测与真实标签不一致的案例。阶段1提示评审者从这些错误中生成有条件的评估标准作为子问题:“如果[条件:适用该标准的情况],哪个响应更好地满足[结论:评估属性]:A、B还是NA?”。标准从评审者自身的错误分布中产生——不像Prometheus5 (https://arxiv.org/html/2608.18303#bib.bib6) 和G-Eval10 (https://arxiv.org/html/2608.18303#bib.bib11) 需要手动指定维度。 阶段2-3(扩展,排序)。阶段2将候选子问题嵌入并聚类成k个主题组。阶段3通过贪婪最远优先遍历4 (https://arxiv.org/html/2608.18303#bib.bib3) 对每个聚类内的子问题进行排序,生成一个深度为n≤n_max的多样性排序的活跃库,无需重新运行聚类,确保了库内标准的正交性。这种排序结构允许在推理时进行深度消融(附录A (https://arxiv.org/html/2608.18303#A1))。 阶段4(总结)。一次LLM调用为每个聚类生成一个泛化的条件从句,作为人类可读的聚类标签。近乎重复的聚类通过LLM二元等价判断进行合并;来自合并聚类的子问题被汇总并重新选择前n个。 阶段5(评估)。层级1向评审者呈现每个抽象的条件从句,并仅为当前样本选择相关聚类,跳过不适用的聚类以减少逐样本成本。层级2用其原始的(错误驱动的)条件从句与其结论配对来回答每个选定的问题,保留阶段1中的具体、实例特定的措辞。当一个标准不适用时(例如,在诗歌提示上的代码聚类),评审者返回NA;NA投票被排除在A/B计数之外,让评审者优雅地跳过不适用的标准。最终偏好是所有选定聚类中A和B选票的多数;如果A和B投票相等,该样本被宣布为平局并被排除在准确率分母之外。 ## 3 实验 ### 3.1 设置 数据集:RewardBench7 (https://arxiv.org/html/2608.18303#bib.bib9),包含聊天、聊天困难、安全和推理子集的2,985个成对偏好样本。开发集(n=1,985)用于错误收集;保留的验证集(n=1,000)用于报告的所有指标。开发/验证划分是完整2,985个样本集的随机划分:1,000个样本留作验证,其余用作开发。 指标:保留验证集上的成对偏好准确率。表1 (https://arxiv.org/html/2608.18303#S3.T1) 报告了CoT整体准确率,并按SESSE是否达成决策进行划分:非平局行(SESSE承诺一个偏好)和平局行(A/B投票相等,SESSE无偏好提供);平局%是平局样本的比例。SESSE准确率仅在非平局行上报告。 模型:Qwen2-VL-7B16 (https://arxiv.org/html/2608.18303#bib.bib1)、Gemini Flash Lite和Gemini 2.5 Flash3 (https://arxiv.org/html/2608.18303#bib.bib2)。 配置:k=25个聚类(通过初步轮廓分析选择),n=10,温度0。每个模型的最佳深度n*通过开发准确率选择。 ### 3.2 主要结果 表1:RewardBench验证集(n=1,000),开发最优n*。‡p<0.05 McNemar检验(非平局子集)。†SFT+DPO。表1 (https://arxiv.org/html/2608.18303#S3.T1) 展示了SESSE在开发最优n*下所有三个评估模型的结果。为确保公平比较,整体基线与SESSE之间的所有差距仅在非平局行上计算,与McNemar检验相匹配,后者同样将其分析限制在两种方法不一致的配对上,检验H0:当预测不一致时,SESSE和CoT整体基线正确的可能性相同。Gemini 2.5 Flash显示出1.3%的较小相对差距,在统计上不显著(p>0.05)。Flash Lite和Qwen2-VL-7B分别显示出6.8%和5.0%的统计显著相对差距(p<0.05)。值得注意的是,使用Gemini 2.5 Flash的SESSE达到了93.3%的准确率,同时平局率较低,为3.5%,使其与专家评估者RISE-Judge (32B)18 (https://arxiv.org/html/2608.18303#bib.bib15) (92.7%) 处于同一性能水平;而RISE-Judge需要SFT+DPO微调,SESSE在保持完全无需训练的同时达到了可比性能并提供了按标准证据。 深度消融(附录A (https://arxiv.org/html/2608.18303#A1))显示了按层级的模式:能力强的评审者(Gemini 2.5 Flash)在每个聚类n=2个子问题时饱和,中层评审者(Flash Lite)从更广泛的证据中受益并在n=5时达到峰值,而最弱的评审者(Qwen2-VL-7B)更早在n=3时达到峰值,之后性能下降。Qwen2-VL-7B在n=3之后的下降揭示了库质量效应:准确率在n=3时达到峰值然后下降,因为在自生成库中,51.9%的实例被单个主导条件从句覆盖——超过n=3后,深度预算被该聚类的冗余子问题消耗。一项跨模型迁移实验——使用Gemini重新生成库,同时保持Qwen2-VL-7B作为评审者——证实准确率上限由评审者能力而非库质量设定(表B.1 (https://arxiv.org/html/2608.18303#A2.T1),附录B (https://arxiv.org/html/2608.18303#A2))。 SESSE平局行是更难的样本:在所有三个模型上,平局行的整体准确率一致低于非平局行(表1 (https://arxiv.org/html/2608.18303#S3.T1))。差距在能力强的评审者中最为明显——Gemini 2.5 Flash在平局行上从94.5%下降到69.5%,表明平局信号代表真正的歧义,而非任意分歧。 ## 4 讨论 与微调评审者达到无需训练的同等水平。SESSE与Gemini 2.5 Flash的CoT整体相比达到接近同等水平(表1 (https://arxiv.org/html/2608.18303#S3.T1)),代表了一种轻微的权衡:以接近同等水平换取无需训练成本的结构化、可审计的按标准证据。CoT整体本身已经优于RISE-Judge18 (https://arxiv.org/html/2608.18303#bib.bib15),因此SESSE的可比准确率主要表明它在无需微调的情况下保留了基础模型的优势。对于中层评审者,差距显著但反映了不同的动态:Flash Lite的下降主要源于安全子集上的层级1假阳性(见下文特定领域信号恢复),而非分解机制本身。 特定领域信号恢复。SESSE的影响在RewardBench子集间差异显著。在donotanswer上,Gemini 2.5 Flash相对于整体方法提升了+20.6%的相对准确率(75.9%→91.5%),因为明确的安全拒绝标准隔离了被整体判断与一般偏好混淆的信号。相反,在xstest-should-respond上下降了27.1%的相对准确率,这是由于边界安全提示上的层级1假阳性,指向层级1精确度是领域敏感子集的关键失败模式。 何时优先选择SESSE。当可解释性重要时,SESSE是更优选择:按标准投票跟踪有助于标注审计并暴露标签噪声,其推理开销在原始准确率之外是合理的。 平局率作为部署时能力信号。平局%是评审者可靠性的无标签代理:Qwen2-VL-7B的21.3%平局率——相对于Gemini模型的2.6-3.5%——预测了其准确率差距,因为评审者在大约五分之一的样本上无法形成方向性偏好(这些样本在被强制进行整体判断时仅得分66.7%;表1 (https://arxiv.org/html/2608.18303#S3.T1))。在保留测试集上高平局率因此发出了能力不匹配或领域偏移的信号,无需真实标签,让从业者可以更换评审者、重新定位库或标记样本供人工审查。 失败模式。当SESSE与整体判断不一致时,分析揭示了依赖能力的失败模式(完整三分类法见表C.1 (https://arxiv.org/html/2608.18303#A3.T1),附录C (https://arxiv.org/html/2608.18303#A3))。我们对Flash Lite和Gemini 2.5 Flash(SESSE准确率高于80%)进行了进一步分析以理解失败模式。对于Flash Lite,分歧大致均匀地分布在真正的标签歧义(49%,高投票熵)、分解失败(26%)和语义等价(26%)之间,反映了一个没有单一主导失败特征的中层评审者。对于能力强的评审者(Gemini 2.5 Flash),48%的分歧反映了响应之间的语义等价(C3):这些配对的响应相似度高于数据集平均值(0.75 vs. 0.69 Sentence-BERT嵌入平均余弦相似度;12 (https://arxiv.org/html/2608.18303#bib.bib22)),并且当不存在有意义的区分时,库正确地返回了高NA率。这种C3特征不是模型失败,而是数据集特性——近一半的Gemini下降行编码了风格偏好而非实质性质量差异,使得按标准投票分布成为独立于准确率测量的轻量级基准审计工具。在所有情况下,按标准投票分布使失败模式可明确诊断,这是单一整体A/B评分所缺乏的特性。 ## 5 结论 我们介绍了SESSE,一个无需训练的框架,它将整体LLM-as-judge评估分解为从评审者自身错误分布中自动推导的A/B/NA子问题。在RewardBench上,对于能力强的评审者,SESSE与CoT整体相比差距不显著,并且与经过微调的专家评估者(RISE-Judge 32B)处于相同的性能范围,同时保持无需训练。除了准确率,按标准投票分布提供了可解释的诊断证据——揭示了整体评分未能清晰呈现的失败模式和基准质量问题——这种用例随着评审者能力的增长而扩展,而非与之对抗。 ## 局限性 库的可移植性。问题库源自特定评审者模型在特定开发集上的错误分布。更改评审者模型或评估领域需要重新构建库。
相似文章
Elmes*:长尾教育场景下大型语言模型细粒度评估标准的自动构建
本文介绍了Elmes+,一个面向长尾教育场景下LLMs细粒度评估标准构建的自动化框架,并提出了涵盖11个学科330个场景的Edu-330基准。该框架使用多智能体引擎和自演化模块来协同优化评估标准与测试数据,揭示了顶级LLMs在多维教育能力上的差异。
@omarsar0: 如果你使用LLM作为评判者,这篇值得一读。(收藏它)这实际上是最有效的使用L…
BinEval是一个新框架,它将LLM评估标准分解为原子化的二元问题,提高了可解释性,并实现了有针对性的提示优化,在事实一致性基准上取得了强劲的结果。
自我评估已然存在:用极少数据激发基础大语言模型中的潜在评判校准
本文介绍了自我评估激发(SEE)方法,该方法通过校准耦合的强化学习和掩码蒸馏,用极少数据激发基础大语言模型中的潜在评判校准,在保持答案质量的同时提升了跨基准的校准效果。
评判电路
本文研究了LLM-as-a-judge的内部机制,发现模型在中期到后期的多层感知机(MLP)中共享一个稀疏的潜在评估器子图,该子图处理抽象评判,而格式特定的终端分支将评判映射到输出令牌,揭示了格式导致的不一致性的原因。
使用语法与语义上下文评估汇总(SSAS)的情感预测一致性分析
本论文提出了SSAS(语法与语义上下文评估汇总)框架,旨在通过分层分类和迭代汇总来减少噪声和方差,提高基于大语言模型的情感预测的一致性。在三个行业标准数据集上的实证评估显示,数据质量和企业决策可靠性可提升30%。