面向比较图的可靠LLM评估的提示扰动

arXiv cs.CL 论文

摘要

提出了一种提示扰动框架,该框架生成扰动的提示变体,通过图级一致性检查过滤掉结构不一致的比较模式,然后应用标准排名方法产生更可靠的LLM排名。

arXiv:2606.17634v1 Announce Type: new Abstract: 评估大语言模型(LLM)对于理解其能力、比较竞争系统以及支持在实际中部署可靠模型至关重要。对于开放式任务,成对评估已成为一种流行范式,即比较同一提示的两个响应,并将获得的判断聚合成整体排名。该范式的核心挑战是非传递性:诱导的比较结果可能无法支持任何一致的全局排名。例如,可能观察到循环偏好,如$A \succ B \succ C \succ A$,或涉及平局的不一致,如$A \equiv B\equiv C\neq A$。这种矛盾使得最终排行榜不稳定且难以解释。在本文中,我们提出了一种提示扰动框架,用于提高成对LLM评估的一致性。我们的方法生成每个提示的扰动变体,利用由此产生的比较图来识别并过滤掉结构不一致的比较模式,然后将标准排名方法应用于过滤后的比较。该框架的一个关键特点是,在排名聚合之前,将图级结构一致性显式纳入评估流程。这提供了一种简单而有原则的方法,可以减少循环不一致性并提高LLM排名的可靠性。
查看原文
查看缓存全文

缓存时间: 2026/06/17 05:41

# 面向比较图的可靠LLM评估的提示扰动方法
来源:https://arxiv.org/abs/2606.17634
查看PDF (https://arxiv.org/pdf/2606.17634)

> **摘要:**评估大型语言模型(LLM)对于理解其能力、比较不同系统以及支持在实践中有序部署可靠模型至关重要。对于开放式任务,成对评估已成为一种流行范式:对同一提示的两个回答进行比较,并将由此产生的判断汇总为整体排名。该范式的核心挑战在于不可传递性:诱导出的比较结果可能无法支撑任何连贯的全局排名。例如,我们可能观察到诸如 \(A \succ B \succ C \succ A\) 的循环偏好,或涉及平局的不一致性,如 \(A \equiv B \equiv C \neq A\)。此类矛盾使得最终排行榜不稳定,难以解读。在本文中,我们提出了一种提示扰动框架,用于提高成对LLM评估的一致性。我们的方法为每个提示生成扰动变体,利用由此产生的比较图来识别并过滤掉结构不一致的比较模式,然后将标准排名方法应用于过滤后的比较结果。该框架的一个关键特性在于,图级别的结构一致性在排名聚合之前就被明确纳入评估流程。这提供了一种简单且有原则的方法,能够减少循环不一致性,提高LLM排名的可靠性。

## 提交历史

来自:董黄 [查看邮件](https://arxiv.org/show-email/404b2251/2606.17634)  
**[v1]** 2026年6月16日星期二 07:44:45 UTC (205 KB)

相似文章

论大型语言模型评估中提示排名的稳定性

arXiv cs.CL

本文系统研究了常见变异来源下,大型语言模型评估中提示排名的稳定性,发现表现最佳的提示经常发生变化。为此,提出了一种基于下置信界的稳定性感知选择策略,以提高鲁棒性。

似然排名在LLMs中的扩展与提示不同

arXiv cs.CL

论文探讨了似然排名与基于提示的评估在LLMs中扩展方式的差异,发现似然准确性在不同模型规模下保持稳定,而提示性能随规模提升,表明它们探测了模型行为的不同方面。

对概率算子进行逻辑推理的LLM能力基准测试

arXiv cs.CL

本文介绍了一个包含14,320个程序化生成提示词的基准测试,用于评估LLM在涉及“probably”“might”“must”等概率算子的逻辑推理上的表现。作者对29个模型进行了测试,发现了系统性的答案偏差,并表明只有9个模型的表现超过了随机水平。