排名质量相同,决策却不同:衡量并减少 LLM 评分器中的顺序依赖性

Hugging Face Daily Papers 论文

摘要

本文指出,基于 LLM 的评分器即使产生相同的排名质量,当提示中候选内容的顺序发生变化时,仍可能做出不同的决策,并提出顺序一致性 SFT(OC-SFT)来惩罚不同排列顺序下分数的不一致。在重排序、响应排序和多文档问答任务上,OC-SFT 在保持排名质量的同时,提升了决策稳定性。

在段落重排序、响应排序和多文档问答任务中,LLM 可以在同一个提示中对多个候选文档或候选响应一并打分,每个候选仍会获得各自的分数。这类评分器通常根据排名质量来挑选,但它们的分数会决定一个决策:分数阈值保留哪些内容、阅读器(reader)回答哪个答案,或者哪一对 chosen/rejected 数据进入偏好训练。由于所有候选共享同一个提示,重新排列候选顺序就会改变它们的分数。对于相同的查询和相同的候选,最终理应产生相同的决策。然而,排名质量相同并不意味着决策相同:在段落重排序任务中,nDCG@10 相差在 0.010 以内的五个已训练评分器,在重新排序后保留的集合重叠度仅为 0.66 到 0.84。我们测试的所有提示层面的修改都无法消除这种依赖性:唯一能提升排名质量的修改,并未在可测量的程度上提升决策稳定性。我们提出了顺序一致性 SFT(OC-SFT),通过对候选在不同顺序下分数之间的不一致施加惩罚,在模型权重层面削弱这种依赖性。它保持了排名质量,并在三个任务的所有已训练评分器中,各项决策稳定性指标均排名第一。与基于不同排列顺序标签平均值进行训练的顺序平均蒸馏方法相比,OC-SFT 在 12 个基础模型上也表现出更强的稳定性。单个 OC-SFT 排列顺序所保留集合的重叠度,甚至超过十个平均后的现成排列顺序的总和。因此,对这类评分器的比较,不应只报告排名质量,还应报告分数阈值保留了什么、阅读器回答了什么。代码见 https://github.com/thomsonreuters/presentation-dependence。
查看原文
查看缓存全文

缓存时间: 2026/10/05 16:49

论文页面 - Equal Ranking Quality, Different Decisions: Measuring and Reducing Order Dependence in LLM Scorers

来源:https://huggingface.co/papers/2608.26762

摘要

在段落重排序(passage reranking)、响应排序以及多文档问答任务中,LLM 可以在同一个提示词中同时为多个候选文档或响应打分,每个候选仍会获得各自的分数。这类打分器是根据排序质量来选择的,但其分数决定了一个决策:某个分数阈值保留哪些候选、阅读器选择哪个候选作答,或者哪一组 chosen/rejected 对进入偏好训练。由于候选共享同一提示词,对它们重新排序会改变其分数。同一个查询在同一组候选上理应产生相同的决策。然而,排序质量相等并不意味着决策相等:在段落重排序任务中,五个训练后的打分器的 nDCG@10 差距在 0.010 以内,但当输入顺序改变时,它们保留的候选集合之间的重叠度仅为 0.66–0.84。我们测试过的所有提示词层面的改动都无法消除这种顺序依赖:唯一能提升排序质量的改动,并没有带来可测量的决策稳定性提升。我们提出顺序一致性 SFT(order-consistency SFT,简称 OC-SFT),它通过惩罚一个候选在不同顺序下的分数不一致,从模型权重层面削弱这种依赖。在全部三个任务上,OC-SFT 保持了排序质量,并在所有训练后的打分器中,在每一项决策稳定性指标上均排名第一。它在 12 个基座模型上的稳定性也优于顺序平均蒸馏(order-averaged distillation,即用跨排列平均得到的标签进行训练)。单次 OC-SFT 所保留的候选集合,其重叠度甚至超过十次现成方法(off-the-shelf)排列平均的结果。因此,对这类打分器的比较不应只报告排序质量,还应报告阈值保留了哪些候选以及阅读器选择哪个候选作答。代码见:https://github.com/thomsonreuters/presentation-dependence

[查看 arXiv 页面 (https://arxiv.org/abs/2608.26762)] [查看 PDF (https://arxiv.org/pdf/2608.26762)] [GitHub 2 (https://github.com/thomsonreuters/presentation-dependence)] [加入收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.26762)]

在你的 agent 中获取这篇论文:

hf papers read 2608.26762

还没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本论文的模型 0

尚无模型链接到本论文

在模型的 README.md 中引用 arxiv.org/abs/2608.26762,即可从此页面链接它。

引用本论文的数据集 0

尚无数据集链接到本论文

在数据集的 README.md 中引用 arxiv.org/abs/2608.26762,即可从此页面链接它。

引用本论文的 Space 0

尚无 Space 链接到本论文

在 Space 的 README.md 中引用 arxiv.org/abs/2608.26762,即可从此页面链接它。

包含本论文的合集 0

尚无合集包含本论文

[将本论文添加到合集 (https://huggingface.co/new-collection)],即可从此页面链接它。

相似文章

面向可靠LLM判断的边际自适应置信度排序

arXiv cs.LG

本文提出了一种针对LLM作为评判系统的基于边际的置信度排序方法,通过学习专用估计器来确保置信度与人类分歧风险之间的单调性,具有泛化保证,并在多个数据集上提高了排序准确性。

量化LLM基准中的排名不确定性

arXiv cs.LG

本文分析了MMLU等LLM基准中排名不确定性的来源,提出了对假设检验的修改,以构建排名置信区间,并表明不同主题间的变异性很大。

超越静态排行榜:LLM智能体评估的预测有效性

Hugging Face Daily Papers

本文认为,针对LLM智能体基准测试的聚合得分排行榜未能捕捉到与部署相关的维度,并且表现出排名不稳定性。文章提出根据预测有效性(即样本内排名与样本外排名之间的相关性)来对配置进行排序,并引入了一个十二层级的测量体系以及可证伪的分布外准则。