锁定证据再做评判:冻结接口降低LLM-as-Judge评估质量
摘要
本文测试了在一次调用中生成证据并将其作为后续裁决的唯一输入(证据锁定)是否会改善或损害LLM-as-Judge评估。在24,000次判断中,他们发现,与结构化单次调用评判相比,证据锁定将人类偏好一致性降低了4到6个百分点,并增加了答案顺序不一致性。
arXiv:2608.05353v1 公告类型:新 \n摘要:LLM评委经常被要求在候选答案之间选择之前提取标准和证据。这种工作流假设中间记录保留了后续裁决所需的信息。对于具有推理能力的模型,可见字段顺序并不揭示内部决策顺序,因此我们测试一种可观察的替代方案:在一次调用中持久化证据,并使其成为下一次调用的唯一输入。在HelpSteer3、FeedbackQA和CoVal上的24,000次判断中,我们比较了标准成对评判、结构化单次调用评判、两次调用证据锁定和三次调用逐点锁定(使用Claude Sonnet 4.5和GPT-5)。与结构化单次调用评判相比,证据锁定将已发布的人类偏好一致性降低了4到6个百分点,并将答案顺序不一致性增加了8到10个百分点。逐点锁定也是有害的,而结构化证据引出仍接近标准评判。这一结果对两个评委和所有三个数据集都成立。持久化的证据可以支持可审计性,但不应在决策时取代源答案。
查看缓存全文
缓存时间: 2026/08/07 07:50
# 冻结接口会降低 LLM-as-Judge 评估的质量 来源:https://arxiv.org/html/2608.05353 ## 先锁定证据再下结论:冻结接口会降低 LLM-as-Judge 评估的质量 ###### 摘要 LLM 裁判常常被要求先提取标准和证据,再在候选答案之间做出选择。这种工作流假设中间记录保留了后续裁决所需的信息。对于具备推理能力的模型,可见的字段顺序并不能揭示内部的决策顺序,因此我们测试一个可观察的替代方案:在一次调用中持久化证据,并让它成为下一次调用的唯一输入。在覆盖 HelpSteer3、FeedbackQA 和 CoVal 的 24,000 次评判中,我们使用 Claude Sonnet 4.5 和 GPT-5 比较了标准成对评判、结构化单次调用评判、两次调用证据锁定和三次调用逐点锁定。相对于结构化单次调用评判,证据锁定与已发布人类偏好的一致性降低了 4 到 6 个百分点,并将答案顺序不一致性提高了 8 到 10 个百分点。逐点锁定同样有害,而结构化证据提取仍接近标准评判。这一结果对两位裁判和全部三个数据集均成立。持久化的证据可以支持可审计性,但不应在决策时取代源答案。 先锁定证据再下结论:冻结接口会降低 LLM-as-Judge 评估的质量 Divyansh Singh 佛罗里达大学 [email protected] ## 1 引言 LLM-as-a-judge 评估现已大规模支持偏好数据构建、基准评分和模型比较(Zhenget al.,2023 (https://arxiv.org/html/2608.05353#bib.bib1))。成对评判部署简单,但其输出依赖于呈现顺序、表层线索和提取协议(Shiet al.,2025 (https://arxiv.org/html/2608.05353#bib.bib2); Chenet al.,2024 (https://arxiv.org/html/2608.05353#bib.bib5); Huanget al.,2026 (https://arxiv.org/html/2608.05353#bib.bib4))。这促使评估器在裁决前要求提供标准、计划或证据(Liuet al.,2023 (https://arxiv.org/html/2608.05353#bib.bib12); Kimet al.,2024 (https://arxiv.org/html/2608.05353#bib.bib13); Sahaet al.,2025 (https://arxiv.org/html/2608.05353#bib.bib3))。 这些工作流做出了比普通理由提示更强的假设:自然语言记录包含足够的信息,供后续调用复现裁决。在模块化或可审计系统中,该记录可能被持久化、审查并在组件之间传递。一旦它成为最终决策的接口,记录中的任何遗漏或框架选择都会成为评估器本身的一部分。 对于具备推理能力的模型,可见的输出顺序并不揭示内部决策顺序。在解释之后写出的裁决并不能证明模型是在推理之后才做出决定。因此,我们干预可观察的信息流。在证据锁定中,一次调用检查上下文和两个答案,在不选择胜者的情况下写出证据,并持久化该记录。第二次调用仅看到该记录,并返回 A、B 或平局。在逐点锁定中,答案先被分别评估,然后第三次调用比较两个冻结的评估结果。标准和结构化单次调用评判在生成裁决时保留对源答案的直接访问。 在两位裁判、三个数据集和两种答案顺序下,锁定协议降低了偏好一致性并增加了顺序不一致性。关键的对比是证据锁定与结构化单次调用评判:两者都要求明确的标准和证据,但只有锁定会冻结产物并从最终调用中移除原始答案。因此,当记录成为排他性接口时,退化才会出现,而不仅仅是在请求证据时。 具体来说,我们的贡献是:(i) 一种可观察的证据锁定干预,不依赖关于隐藏思维链顺序的主张;(ii) 一项覆盖 Claude Sonnet 4.5、GPT-5、HelpSteer3、FeedbackQA 和 CoVal 的 24,000 次评判重复测量评估;(iii) 一个一致的负面结果,表明锁定的证据会降低偏好一致性和顺序鲁棒性,而结构化单次调用提取仍接近标准评判。 ## 2 相关工作 先前的工作推动了结构化 LLM 评估,但并未测试持久化的证据记录何时成为后续裁决的排他性接口。这正是我们填补的空白。 #### LLM 裁判与鲁棒性。 MT-Bench 和 Chatbot Arena 确立了基于 LLM 的成对评估,同时记录了位置、冗长和自我增强效应(Zhenget al.,2023 (https://arxiv.org/html/2608.05353#bib.bib1))。后续工作研究了位置偏差、答案顺序交换以及与人类偏好的校准(Shiet al.,2025 (https://arxiv.org/html/2608.05353#bib.bib2); Liuet al.,2024 (https://arxiv.org/html/2608.05353#bib.bib6))。我们使用相同的反事实交换,但问题是评判工作流是否会改变该交换下的鲁棒性。 #### 结构化评估。 G-Eval 将显式推理与基于表单的评分相结合,Prometheus 则根据细粒度标准评估响应(Liuet al.,2023 (https://arxiv.org/html/2608.05353#bib.bib12); Kimet al.,2024 (https://arxiv.org/html/2608.05353#bib.bib13))。EvalPlanner 和 PlanJudge 在最终评估之前放置显式计划(Sahaet al.,2025 (https://arxiv.org/html/2608.05353#bib.bib3); Huanget al.,2026 (https://arxiv.org/html/2608.05353#bib.bib4))。这些方法推动了结构化产物的应用。我们的问题不同:当产物被冻结且最终裁判无法再检查原始答案时,会发生什么? #### 理由与忠实性。 可见的解释不一定忠实反映模型产生答案的原因(Turpinet al.,2023 (https://arxiv.org/html/2608.05353#bib.bib14))。LLM 和人类评估者也会表现出系统性判断偏差(Chenet al.,2024 (https://arxiv.org/html/2608.05353#bib.bib5))。因此,我们通过调用边界和源访问来定义干预,并将理由-参考对齐视为探索性分析,而非忠实内部推理的证据。 ## 3 方法 ### 3.1 可观察的评判协议 每个输入包含一个任务上下文和两个候选答案。我们比较四种协议(图1 (https://arxiv.org/html/2608.05353#S3.F1))。每个最终决策允许 A、B 或平局;只有决策调用可用的信息发生变化。 参见说明图 1:四种评判协议中的可观察信息流。标准和结构化评判在裁决时保留源访问;锁定协议用持久化记录替换源对。标准和结构化评判的区别在于输出格式,而非源访问。证据锁定增加了持久化的中间记录和第二次调用,该调用无法看到原始上下文或答案。逐点锁定进一步在提取期间通过独立评估 A 和 B 来移除直接比较。 ### 3.2 结果与配对分析 统计单位是比较 ID。偏好一致性是与已发布严格 A/B 标签相比的正确率,在每个协议内对 AB 和 BA 显示顺序取平均。答案顺序不一致性是每个比较和协议的一个二元结果:即候选答案交换后归一化裁决是否改变。 我们报告四个配对对比:结构化减标准、证据锁定减标准、逐点锁定减标准、以及证据锁定减结构化。置信区间使用对比较 ID 的 10,000 次非参数自助法重采样。正文结果强调点估计;完整配对区间见表2 (https://arxiv.org/html/2608.05353#Sx2.T2)。 ## 4 实验设置 ### 4.1 数据集与评估单元 三个来源具有不同的标注结构。我们将每个来源归一化为相同的成对单元: > 上下文 + 答案 A + 答案 B + 严格人类偏好答案 + 人类理由。 表 1:将已发布来源转换为共同成对评估单元。HelpSteer3 已提供响应对(Wanget al.,2025 (https://arxiv.org/html/2608.05353#bib.bib7));FeedbackQA 通过为每个问题配对评分最高和最低的段落进行转换(Liet al.,2022 (https://arxiv.org/html/2608.05353#bib.bib8));CoVal 为每个提示提供一个严格多数对(OpenAI,2025a (https://arxiv.org/html/2608.05353#bib.bib9))。每个归一化单元包含一个比较 ID、上下文、规范答案 A 和 B、严格黄金标签、已发布的人类理由和源元数据。这些来源支持相同的预测任务,但难度或质量定义不必相同,因此我们也按数据集报告结果。 ### 4.2 采样、裁判与生成 使用种子 20260803,我们从每个来源采样 500 个单元,共产生 1,500 个独立比较。每个单元在四种协议、AB 和 BA 两种顺序以及两位裁判下进行评估,共产生 24,000 次有效评判。BA 的裁决在分析前映射回规范 A/B 标签。 我们使用通过供应商 API 提供的两个具备推理能力的专有裁判:Claude Sonnet 4.5(claude-sonnet-4-5-20250929)(Anthropic,2025 (https://arxiv.org/html/2608.05353#bib.bib11)) 和 GPT-5 的推理配置(gpt-5)(OpenAI,2025b (https://arxiv.org/html/2608.05353#bib.bib10))。两者均启用推理并跨数据集使用相同的协议模板。GPT-5 以高推理努力运行;Claude Sonnet 4.5 早于 Anthropic 的努力参数,使用固定的扩展思考预算。两家供应商都不接受启用推理时温度为 0,因此解码并非贪婪,重复调用不必相同。完整提示模板、归一化记录和运行元数据见附录。 ### 4.3 探索性理由分析 对于 Claude Sonnet 4.5,一个单独的模型标注流程将裁判解释与已发布理由参考进行比较。它标记决定性标准召回率、无依据主张、矛盾、捷径使用、裁决与理由之间的一致性,以及“理由错误但结论正确”的情况。这些是相对于人类参考的模型派生标签,而非人类验证研究;我们仅将其用作次要证据。 ## 5 结果 我们问三个问题。第一,锁定接口是否保持与已发布偏好的一致性?第二,它是否提高了对答案顺序的鲁棒性?第三,该效应是否跨数据源传递?图2 (https://arxiv.org/html/2608.05353#S5.F2) 报告合并结果;配对置信区间见表2 (https://arxiv.org/html/2608.05353#Sx2.T2)。 参见说明图 2:按协议划分的合并偏好一致性和答案顺序不一致性。结构化单次调用评判保持接近标准评判,而两种锁定协议都降低了一致性并增加了不一致性。 ### 5.1 证据锁定降低偏好一致性 对于两位裁判,结构化评判与标准协议保持接近:Claude Sonnet 4.5 为 76.0% 对 75.3%,GPT-5 为 75.6% 对 75.8%。证据锁定降至 71.7% 和 70.0%,而逐点锁定降至 67.3% 和 69.2%。相对于结构化评判,证据锁定将一致性降低了 4.3 和 5.6 个百分点。因此,显式证据提取并不是损失来源;当记录变得冻结和排他时,下降才会出现。 ### 5.2 锁定协议增加答案顺序不一致性 证据锁定将不一致性从 Claude Sonnet 4.5 的 10.9% 提高到 18.9%,从 GPT-5 的 8.3% 提高到 15.9%。相对于结构化评判,这些是 9.5 和 8.0 个百分点的增加。逐点锁定在鲁棒性上也明显低于标准评判。因此,在提取期间分离答案并不能消除最终决策的顺序敏感性。 ### 5.3 该效应跨数据集传递 在所有六种裁判与数据集组合中,证据锁定的准确性都低于标准评判。变化分别为 Claude Sonnet 4.5 在 HelpSteer3、FeedbackQA 和 CoVal 上的 -2.4、-4.5 和 -3.8 个百分点,以及 GPT-5 的 -4.2、-5.9 和 -7.2 个百分点。逐点锁定在所有六个单元中也为负。该结果并非由单一来源或单一质量定义驱动。 ### 5.4 锁定消耗更多计算 对于 Claude Sonnet 4.5,每个显示顺序评判的平均完成 token 数从标准评判下的 1,279 和结构化评判下的 1,864 上升到证据锁定下的 4,183 和逐点锁定下的 6,825。四种协议分别需要一次、一次、两次和三次调用。因此,锁定评判使用更多调用和 token,同时产生更低的一致性和更差的顺序鲁棒性。 探索性理由分析方向相同:锁定协议更少地恢复决定性人类标准,并产生更多“理由错误但结论正确”的情况。完整结果和区间见附录C (https://arxiv.org/html/2608.05353#A3)。 ## 6 讨论 #### 证据记录不是充分的接口。 结构化和锁定评判都要求显式标准和证据,但只有锁定协议急剧退化。自然语言记录可能省略区别、压缩权衡或保留依赖位置的框架。一旦最终调用失去源访问,它就无法修复这些选择。 #### 可审计性应保留源访问。 持久化的证据仍可支持审查、日志记录和模块化。实际教训更窄:记录应辅助决策,而非取代原始对。最终裁判可以同时检查产物和源答案,系统也可以允许在产物不完整时进行修正。 #### 该结果是信息流效应,而非隐藏推理的主张。 实验识别的是最终调用可以观察什么,而不是模型内部何时决定。该干预还捆绑了阶段分离、额外调用、记录冻结和源答案移除。因此,信息瓶颈解释是一种合理的解读,而非唯一确定的机制。 ## 7 结论 先给证据再下结论并非自动有益。在两位裁判和三个数据集上,将持久化的证据记录作为裁决的排他性输入会降低偏好一致性、增加答案顺序不一致性并消耗更多计算;而结构化单次调用证据提取则没有表现出同样的退化。 ## 局限性 本评估覆盖了在一个固定解码配置下的两个专有推理型裁判。其他模型系列、提供商和设置可能表现不同,托管端点也可能在固定模型标识符下发生变化。 证据锁定是一种捆绑式干预。它增加了一次调用、冻结了记录、将提取与决策分离,并从最终调用中移除了源访问。该设计确立了该工作流的效果,但并未隔离哪个组件导致了退化。 目标是已发布的人类偏好,而非客观正确性标签。它们可能包含标注噪声和特定于来源的质量概念。理由分析也是模型派生的,不应被解读为经过人类验证的解释质量。 每个数据集贡献 500 个采样比较。这支持跨协议和顺序的配对估计,但并未穷尽任何来源中的全部任务或标注条件。 ## 伦理考虑 本研究使用已发布的文本和偏好标注,不收集新的参与者数据。我们仅保留所需字段以执行评估,不存储可识别的个人信息。
相似文章
抛硬币裁判?LLM-as-a-Judge评估的可靠性与偏见
本文研究了LLM-as-a-Judge评估的运行间可靠性,发现平均13.6%的成对偏好会发生翻转,GPT-4o-mini存在显著的首位偏见,并建议采用多试次聚合与位置随机化。
是时候 REFLECT 了:我们能信任 LLM 评判者来评估基于证据的研究代理吗?
本文介绍了 REFLECT,这是一个用于评估 LLM 评判者在深度研究代理评估中可靠性的元评估基准。实验表明,当前的 LLM 评判者仍然不可靠,在推理、工具使用和报告质量失败方面的整体准确率低于 55%。
先承诺后推理:开放权重LLM中回答预承诺的行为复现与初步激活级证据
本文使用一个极简的洗车问题,在开放权重大型语言模型(Qwen3-8B)中复现了回答预承诺现象,并提供了初步激活级证据,表明承诺在答案文本生成之前就已编码在隐藏状态中。
ForeSci:评估LLM代理的前瞻性AI研究判断
介绍了ForeSci,一个时间控制基准,用于评估LLM代理是否能够基于历史证据做出前瞻性研究判断。它包含跨越四个AI领域的500个任务,结果表明显式的证据组织提高了可追溯性,但揭示了反复出现的证据-决策解耦。
忠实还是虚构?LLM评审中合理化偏见的因果框架
本文提出了一个因果框架,用于量化LLM评审中的合理化偏见,即判决和解释受非证据性线索而非底层文本的影响。该框架提出了线索干预、锚定度量以及Proof-Before-Preference缓解协议,展示了改进的线索不变性。