相同问题,不同答案:超越准确性评估LLM的可靠性

arXiv cs.AI 论文

摘要

本文研究了LLM在保持意义不变的改写下答案的变化,发现实例级行为不稳定(翻转率>23%),单提示准确性掩盖了显著的不一致性,而自我改写策略可以部分恢复潜在知识。

arXiv:2607.22554v1 公告类型:新 摘要:大型语言模型(LLM)通常在基准测试中达到很高的准确率,但尚不清楚当同一个问题以不同但等价的方式表述时,它们应用这些知识的可靠性如何。在这项工作中,我们研究了在事实问答和数学推理任务中,模型答案在保持意义不变的改写下如何变化。跨四个基准测试和13个模型,我们发现模型输出经常依赖于提示的确切措辞。虽然整体准确率在改写之间通常只发生微小变化,但实例级行为远不稳定:对于许多问题,模型根据措辞在正确和错误答案之间切换,不一致率超过23%。在原始形式回答正确的问题上,以答案翻转率衡量的失败甚至更大,表明单提示正确性通常是可靠性的一个糟糕指标。同时,我们发现模型通常对至少一个改写版本产生正确答案,这表明潜在知识存在但检索不一致。基于这一观察,我们展示了一种简单的自我改写策略可以部分恢复这种潜在知识并提高推理时的性能。这些发现共同表明,标准准确率指标可能掩盖了显著的不稳定性,评估等价输入之间的一致性提供了LLM可靠性的更清晰图景。
查看原文
查看缓存全文

缓存时间: 2026/07/28 06:23

# 评估 LLM 可靠性超越准确率 来源:https://arxiv.org/html/2607.22554 ## 同一问题,不同答案:评估 LLM 可靠性超越准确率  
Kazem Faghih Yize Cheng¹  Shoumik Saha  Mobina Pournemat  Armin Gerami  Soheil Feizi  
马里兰大学帕克分校 \{kazemf, yzcheng, smksaha, mpournem, agerami, sfeizi\}@umd\.edu  
项目地址:https://github.com/kazemf78/llm-consistency-study.git  

###### 摘要  
大型语言模型(LLMs)在基准测试中常常取得很高的准确率,但它们能否在语义等价的不同措辞下可靠地应用这些知识仍不明确。在本工作中,我们研究了在事实问答和数学推理任务中,模型答案在保持意义不变的改写下如何变化。在四个基准和13个模型上,我们发现模型输出常常依赖于提示语的具体措辞。虽然整体准确率在不同改写下通常只有小幅变化,但在实例层面的行为却远不稳定:许多问题中,模型会根据措辞在正确和错误答案之间交替,不匹配率最高超过23%。以原始形式回答正确的问题为条件,答案翻转率会暴露出更大失误,表明单提示的正确性通常是可靠性的糟糕指标。同时,我们发现模型常常在问题的*至少一个*改写版本上给出正确答案,这表明底层知识是存在的但未能一致地检索出来。基于这一观察,我们展示了一种简单的自我改写策略可以部分恢复这种潜在知识并在推理时提升性能。这些发现共同表明,标准准确率指标可能掩盖了显著的不稳定性,而在等价输入上评估一致性能够更清晰地揭示LLM的可靠性。

## 1 引言  
大型语言模型(LLMs)在自然语言理解[11 (https://arxiv.org/html/2607.22554#bib.bib28),3 (https://arxiv.org/html/2607.22554#bib.bib23),8 (https://arxiv.org/html/2607.22554#bib.bib27)]、问答[34 (https://arxiv.org/html/2607.22554#bib.bib33),23 (https://arxiv.org/html/2607.22554#bib.bib32)]和推理[41 (https://arxiv.org/html/2607.22554#bib.bib31),19 (https://arxiv.org/html/2607.22554#bib.bib30)]方面展现了卓越的能力。随着这些模型在日益扩大的实际应用中被部署,一个重要且常常被低估的可靠性维度是输出在语义等价输入下的一致性。虽然在开放式场景(如摘要和创意生成[22 (https://arxiv.org/html/2607.22554#bib.bib11)])中,可变性可以被接受甚至可取,但许多高风险或决策关键的工作流程要求行为不变:*保持意义的重述应产生保持意义的输出。*这种变化在实际使用中自然出现,不同用户通过多样的措辞表达相同意图。这凸显了可靠部署的一个基本要求:在保持意义不变的语言变化下的一致性。事实问答和数学问题求解是清晰的反例,不一致性直接破坏可靠性;类似问题也出现在分类、结构化预测等任务中。当模型对同一输入的语义等价版本给出相互矛盾的答案时,我们不禁质疑它是否真正捕捉到了底层含义和核心语义,还是仅仅依赖表面线索或表层模式。因此,表征模型在保持意义不变的变换下的行为一致性对于衡量LLM在实际部署中的真实可靠性至关重要。

虽然一些研究考察了LLM对输入变化的鲁棒性[2 (https://arxiv.org/html/2607.22554#bib.bib41),29 (https://arxiv.org/html/2607.22554#bib.bib43),37 (https://arxiv.org/html/2607.22554#bib.bib44)],但大多数关注相对浅层的扰动,比如提示格式变化、微小的词汇编辑或对抗性噪声,并且通常在多项选择设置中评估,这不能反映开放式生成的复杂性。最近的努力[26 (https://arxiv.org/html/2607.22554#bib.bib40),7 (https://arxiv.org/html/2607.22554#bib.bib45)]开始大规模研究改写级别的变化,表明仅改述就能显著影响模型预测。然而,这些研究大多局限于多项选择任务,其中输出可变性受到内在限制。此外,近期工作[31 (https://arxiv.org/html/2607.22554#bib.bib35),24 (https://arxiv.org/html/2607.22554#bib.bib36)]认为多项选择评估可能误导对模型在现实场景中行为的理解。更重要的是,他们的评估主要依赖聚合准确率指标,这掩盖了实例级别的变化以及单个预测如何在改写之间变化,从而在平均值背后掩盖了显著的内在脆弱性。此外,这些研究中使用的改写常常在未经严格语义验证的情况下生成,使得观察到的不一致性是来自模型本身还是改写中的“意义漂移”变得不明确。这些局限性共同导致了对LLM在保持意义的重述下真正稳定性的不完整和粗粒度理解。

为了解决这些空白,我们展示了标准评估会系统地掩盖一个关键的失败模式:在语义等价输入下的显著实例级不稳定性。为了描述这一现象,我们引入了一个基于经过严格验证的改写集细粒度评估框架。我们采用受约束的生成过程结合严格的语义检查,确保给定问题的每个变体在语义上是完全相同的。我们进一步在确定性解码下评估模型,以将观察到的可变性归因于模型本身而非随机采样。我们不只依赖聚合准确率,而是表征改写引起的*答案分布*:我们测量输出在不同改写间变化的频率,量化每个改写集内的不一致性,并追踪同一问题不同表述下的正确性变化。这种实例级视角使我们能够更精确和细粒度地评估模型稳定性。我们在事实和数学推理任务上跨4个数据集和13个模型进行了广泛实验,发现即使在确定性解码和严格语义等价控制下,当前LLM也表现出显著的措辞引发的不一致性。尽管聚合准确率的变化相对较小(通常在0%到5%之间),这些平均值掩盖了实例级的显著不稳定性。高达23%的问题在改写后获得了不同的正确性标签,高达47%的改写集包含冲突的预测。模型常常在原始问题上回答正确,但在语义等价的改写上失败,并且在许多情况下,在原始输入失败后却在改写上成功。这些结果表明LLM的行为远不如标准评估所显示的稳定,并突出了对更细粒度一致性分析的需求。

我们还揭示了模型潜在知识与观察到的性能之间的关键差异。在许多情况下,模型拥有内部能力来正确回答,这在至少一个改写上成功得到证明,然而它们常常未能一致地从语义等价的输入中检索出这些知识。相反,仅将评估限制在持续正确的答案上暴露了一个“可靠性差距”,其中性能显著低于标准准确率指标。我们通过定义最大(潜在)、期望和可靠能力的度量来形式化这些区别,量化它们之间的显著差异,以提供对模型鲁棒性和能力的更严格视角。

我们的核心贡献可概括如下:
- • 我们提出了一个受控框架,使用经过严格验证的语义等价问题来衡量LLM的一致性,从而实现对自由形式生成中预测分布的细粒度分析,超越多项选择设置和聚合指标。
- • 我们对开源和专有模型在事实和数学问答基准上进行了大规模实证研究,系统地刻画了改写引发的不一致性、正确性翻转以及在保持意义输入下的不稳定性。
- • 我们识别了LLM评估中一个未被充分探索的失败模式:在保持意义输入下实例级的不稳定性,包括正确性翻转以及潜在能力($A_{\text{any}}$)与可靠能力($A_{\text{strict}}$)之间的**可靠性差距**,即使准确率保持稳定。我们的结果强调,聚合准确率指标常常掩盖且未能揭示显著的实例级不一致性,并可能提供对LLM可靠性不完整且常常过于乐观的看法。模型可能在某些改写上正确回答,却在其他改写上失败,揭示了潜在能力与可靠性能之间的显著差距。这些发现强调了在改写输入上进行一致性感知评估对于可靠评估LLM可靠性和能力的必要性。

参见图注  
图1:评估框架概览。对于每个输入问题,我们使用受控生成和验证生成多个语义等价的改写,并评估模型在这些改写上的响应。示例展示了预测如何在不同改写间变化,揭示了尽管输入语义等价,但仍存在实例级的不稳定性。

## 2 相关工作  
在保持意义不变的变换下的一致性是可依赖NLP系统的核心要求。Ribeiro等人[36 (https://arxiv.org/html/2607.22554#bib.bib37)]通过不变性测试形式化了这一原则,然而实证工作表明它经常被违反:Gan和Ng [13 (https://arxiv.org/html/2607.22554#bib.bib38)]观察到在改写后的SQuAD问题上准确率大幅下降,Elazar等人[12 (https://arxiv.org/html/2607.22554#bib.bib39)]表明预训练语言模型常常不一致地回答改写后的事实查询。最近的研究表明标准评估可能进一步掩盖这种不稳定性。例如,Burnell等人[4 (https://arxiv.org/html/2607.22554#bib.bib54)]认为仅报告聚合评估指标使得理解模型何时以及为何失败变得困难,并倡导更细粒度的实例级分析。类似地,Lunardi等人[26 (https://arxiv.org/html/2607.22554#bib.bib40)]发现改写基准问题导致显著的性能下降,同时很大程度上保留了排行榜排名;Alzahrani等人[2 (https://arxiv.org/html/2607.22554#bib.bib41)]表明即使微小的基准扰动也能影响排行榜结果。相关工作还认为单提示评估是不可靠的[32 (https://arxiv.org/html/2607.22554#bib.bib42),29 (https://arxiv.org/html/2607.22554#bib.bib43)],Sclar等人[37 (https://arxiv.org/html/2607.22554#bib.bib44)]展示了琐碎的、保持意义的提示格式更改可以引起高达76个准确率点的波动。Choi [7 (https://arxiv.org/html/2607.22554#bib.bib45)]引入了RoParQ来衡量多项选择问答中的跨改写一致性。然而,这些研究大多将输入变化聚焦在提示格式和基准结构上,或者将设置限制在多项选择或完形填空任务而非自由形式生成,没有暴露被聚合指标掩盖的实例级不稳定性。

并行的工作也探索了推理和知识任务中的鲁棒性和表面形式敏感性。Zhou等人[43 (https://arxiv.org/html/2607.22554#bib.bib46)]和Han等人[20 (https://arxiv.org/html/2607.22554#bib.bib47)]表明改写数学问题可以显著改变LLM的性能,而Meier等人[27 (https://arxiv.org/html/2607.22554#bib.bib48)]发现更深的句法改写尤其具有挑战性。GSM-Symbolic[28 (https://arxiv.org/html/2607.22554#bib.bib49)]进一步表明微小的符号变化或逻辑上无关的从句会导致较大的性能方差。其他工作提出了更广泛的一致性和鲁棒性框架[30 (https://arxiv.org/html/2607.22554#bib.bib50),35 (https://arxiv.org/html/2607.22554#bib.bib52),14 (https://arxiv.org/html/2607.22554#bib.bib53)]。然而,这些研究通常测量聚合准确率变化或依赖任务特定的扰动。相比之下,我们系统地分析跨通过任务无关改写获得的语义等价输入的实例级答案分布。

## 3 细粒度评估一致性与可靠性的框架  
我们引入一个框架来通过衡量LLM对非对抗性改写的不变性来评估其可靠性。与旨在诱发失败的对抗性扰动不同,我们的变换严格保持意义并反映自然语言变化。我们的方法由两个核心组件组成:一个用于生成语义等价测试集的严格管道,以及一组定义在标准准确率或聚合准确率之上衡量一致性的度量。框架概览如图1 (https://arxiv.org/html/2607.22554#S1.F1)所示。

### 3.1 构建语义等价的测试集  
为了隔离表面形式对模型预测的影响,我们需要一组措辞不同但语义相同的输入。对于来自标准基准的给定原始查询$Q^0$,我们生成一组$k$个改写$\mathcal{P}=\{Q^1,\dots,Q^k\}$,采用三阶段验证过程以防止意义漂移:

##### (i) 受控生成。  
对于每个原始问题$Q^0$(图1中的![[未标图]](https://arxiv.org/html/2607.22554v1/x2.png)),我们使用高能力指令微调模型GPT-4.1-mini生成多个语义等价的改写(图1中的![[未标图]](https://arxiv.org/html/2607.22554v1/x3.png))。为了在保持原始意图、假设和所需信息的同时引入受控的语言可变性,我们根据轻量级提示线索生成立即生成,这些提示鼓励中立的结构性改写或风格变化(例如语气)。完整的提示模板和实现细节见附录B.1 (https://arxiv.org/html/2607.22554#A2.SS1)。

##### (ii) 词汇重叠过滤。  
为了避免仅与原始查询表面上不同的改写(例如通过标点变化或近乎逐字的重写),我们基于词汇重叠过滤候选。我们将词汇重叠定义为改写与原始查询之间共享词标记的比例,除以较短文本的长度。仅保留词汇重叠低于0.8的改写。

##### (iii) 双阶段语义验证。  
为了确保严格等价,我们在独立步骤中采用两个过滤器。首先,我们使用LLM裁判GPT-4.1-mini验证每个$Q^i$是否要求与$Q^0$完全相同的信息。

相似文章

大语言模型在不信任输入数据时是否会犯更多错误?

arXiv cs.CL

本文分析了大语言模型对提供上下文的忠实度如何取决于其感知的合理性,使用多种语言的事实性、反事实性和虚构性RDF三元组。研究发现上下文-记忆冲突较弱,并强调LLM判断者的选择可能高估其强度。

评估 LLM 在受控实验中作为人类代理的可靠性

arXiv cs.CL

本论文通过比较 LLM 生成的数据与人类在准确性感知调查中的反应,评估现成 LLM 是否能可靠地模拟受控行为实验中的人类反应。研究发现,虽然 LLM 能捕捉方向性效应和聚合信念更新模式,但它们的效应大小与人类尺度不一致,这有助于澄清合成 LLM 数据何时可以作为行为代理。