排名质量相同,决策却不同:衡量并减少 LLM 评分器中的顺序依赖性
摘要
本文指出,基于 LLM 的评分器即使产生相同的排名质量,当提示中候选内容的顺序发生变化时,仍可能做出不同的决策,并提出顺序一致性 SFT(OC-SFT)来惩罚不同排列顺序下分数的不一致。在重排序、响应排序和多文档问答任务上,OC-SFT 在保持排名质量的同时,提升了决策稳定性。
查看缓存全文
缓存时间: 2026/10/05 16:49
论文页面 - Equal Ranking Quality, Different Decisions: Measuring and Reducing Order Dependence in LLM Scorers
来源:https://huggingface.co/papers/2608.26762
摘要
在段落重排序(passage reranking)、响应排序以及多文档问答任务中,LLM 可以在同一个提示词中同时为多个候选文档或响应打分,每个候选仍会获得各自的分数。这类打分器是根据排序质量来选择的,但其分数决定了一个决策:某个分数阈值保留哪些候选、阅读器选择哪个候选作答,或者哪一组 chosen/rejected 对进入偏好训练。由于候选共享同一提示词,对它们重新排序会改变其分数。同一个查询在同一组候选上理应产生相同的决策。然而,排序质量相等并不意味着决策相等:在段落重排序任务中,五个训练后的打分器的 nDCG@10 差距在 0.010 以内,但当输入顺序改变时,它们保留的候选集合之间的重叠度仅为 0.66–0.84。我们测试过的所有提示词层面的改动都无法消除这种顺序依赖:唯一能提升排序质量的改动,并没有带来可测量的决策稳定性提升。我们提出顺序一致性 SFT(order-consistency SFT,简称 OC-SFT),它通过惩罚一个候选在不同顺序下的分数不一致,从模型权重层面削弱这种依赖。在全部三个任务上,OC-SFT 保持了排序质量,并在所有训练后的打分器中,在每一项决策稳定性指标上均排名第一。它在 12 个基座模型上的稳定性也优于顺序平均蒸馏(order-averaged distillation,即用跨排列平均得到的标签进行训练)。单次 OC-SFT 所保留的候选集合,其重叠度甚至超过十次现成方法(off-the-shelf)排列平均的结果。因此,对这类打分器的比较不应只报告排序质量,还应报告阈值保留了哪些候选以及阅读器选择哪个候选作答。代码见:https://github.com/thomsonreuters/presentation-dependence
[查看 arXiv 页面 (https://arxiv.org/abs/2608.26762)] [查看 PDF (https://arxiv.org/pdf/2608.26762)] [GitHub 2 (https://github.com/thomsonreuters/presentation-dependence)] [加入收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.26762)]
在你的 agent 中获取这篇论文:
hf papers read 2608.26762
还没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本论文的模型 0
尚无模型链接到本论文
在模型的 README.md 中引用 arxiv.org/abs/2608.26762,即可从此页面链接它。
引用本论文的数据集 0
尚无数据集链接到本论文
在数据集的 README.md 中引用 arxiv.org/abs/2608.26762,即可从此页面链接它。
引用本论文的 Space 0
尚无 Space 链接到本论文
在 Space 的 README.md 中引用 arxiv.org/abs/2608.26762,即可从此页面链接它。
包含本论文的合集 0
尚无合集包含本论文
[将本论文添加到合集 (https://huggingface.co/new-collection)],即可从此页面链接它。
相似文章
面向可靠LLM判断的边际自适应置信度排序
本文提出了一种针对LLM作为评判系统的基于边际的置信度排序方法,通过学习专用估计器来确保置信度与人类分歧风险之间的单调性,具有泛化保证,并在多个数据集上提高了排序准确性。
量化LLM基准中的排名不确定性
本文分析了MMLU等LLM基准中排名不确定性的来源,提出了对假设检验的修改,以构建排名置信区间,并表明不同主题间的变异性很大。
接近持平的大语言模型排名是否对族DIF引导的基准测试重组具有鲁棒性?
本研究通过心理测量方法,探讨接近持平的大语言模型排名在基准测试项目组成变化下的鲁棒性。研究发现,尽管整体排名保持稳定,但个别接近的排序可能因项目选择而发生逆转。
@rohanpaul_ai: LLM排名既取决于模型差异,也深受评估选择影响,因此单一设置绝不应决定排行榜…
研究表明,LLM排名对评估设置选择高度敏感,例如提示格式和评分方法,导致模型性能和排名的显著差异。
超越静态排行榜:LLM智能体评估的预测有效性
本文认为,针对LLM智能体基准测试的聚合得分排行榜未能捕捉到与部署相关的维度,并且表现出排名不稳定性。文章提出根据预测有效性(即样本内排名与样本外排名之间的相关性)来对配置进行排序,并引入了一个十二层级的测量体系以及可证伪的分布外准则。