对概率算子进行逻辑推理的LLM能力基准测试
摘要
本文介绍了一个包含14,320个程序化生成提示词的基准测试,用于评估LLM在涉及“probably”“might”“must”等概率算子的逻辑推理上的表现。作者对29个模型进行了测试,发现了系统性的答案偏差,并表明只有9个模型的表现超过了随机水平。
arXiv:2607.27405v1 公告类型:新
摘要:不确定性表达和推理在自然语言中无处不在,而对自然语言不确定性表达进行有效推理不仅对日常对话必不可少,对医学、法律等高利害领域也是如此。尽管大语言模型越来越多地在逻辑推理任务上受到评估,但要区分基于原则的符号推理与巧妙的表层模式匹配仍然困难重重。我们引入了一个针对概率算子推理的基准测试——对带有程度性认知情态词(如probably、might、must)的句子进行推理,包含15种推理模板下的14,320个程序化生成的英语提示词,系统性地变化问题形式、否定策略和表层内容。在评估29个模型时,我们发现大多数模型表现出与逻辑形式无关的答案偏差,即系统性地偏向“是”或“否”。我们将此概括为一个能力下限:模型在答案为“是”和答案为“否”的项目上的准确率中较低的那个。29个模型中只有9个超过了随机水平。我们还测试了问题形式、动词短语/活动、以及提示词中姓名的性别和来源的变化,发现每个维度上都存在偏差。
查看缓存全文
缓存时间: 2026/07/31 10:01
# 在概率算子上的逻辑推理中基准测试 LLM 能力 来源:https://arxiv.org/html/2607.27405 Jack Greff Haverford College Alvin Grissom II Haverford College ###### 摘要 不确定性的表达和推理在自然语言中无处不在,而对自然语言不确定性表达进行有效推理,不仅对日常对话必不可少,对医学和法律等高 stakes 领域也同样如此。尽管大型语言模型越来越多地被用于评估逻辑推理任务,但要厘清原则性的符号推理与巧妙的表层模式匹配之间的区别却困难重重。我们引入了一个针对概率算子推理的基准——对带有可分级认知情态词(如 probably、might、must)的句子进行推理,该基准包含 14,320 个程序化生成的英语提示,涵盖十五种推理模板,并系统性地变化了提问形式、否定策略和表层内容。通过评估 29 个模型,我们发现大多数模型表现出与逻辑形式无关的答案偏差,即对“是”或“否”的系统性偏好。我们将其总结为一个“能力下限”:模型在“正确答案为是”和“正确答案为否”的项目上准确率中的较差者。29 个模型中只有 9 个超过随机水平。我们还测试了提问形式、动词短语/活动以及提示中名字的性别和来源的变化,发现每个维度上都存在偏差。 ## 1 引言 认知情态词(EMs)表达知识、不确定性、置信度或信念的状态,这类情态词在人类语言中无处不在(Teller,1972(https://arxiv.org/html/2607.27405#bib.bib42))。在英语中,认知情态(EM)主要通过情态动词如 must、might、may,以及副词如 probably 来实现,它渗透于日常语言和专业语言之中。例如,句子“Bob might be home early”和“Bob will possibly be home early”表达的是鲍勃有可能提前到家,但不一定是高概率;而句子“Bob must be home early”的认知情态语气则表达了他肯定会提前到家。虽然模态逻辑处理的是表达必然性和可能性的那部分情形——例如 must 和 might——但可分级认知情态还包括表达确定性程度的例子,即所谓的概率算子(Yalcin,2010(https://arxiv.org/html/2607.27405#bib.bib3))。 在我们的工作中,我们基于理论研究,这些理论研究的是包含概率算子的自然语言句子上的推理规则(Yalcin,2010(https://arxiv.org/html/2607.27405#bib.bib3)),以此来基准测试和分析 LLM 在零样本逻辑推理中正确处理大量程序化生成的 EM 句子的能力。EM 在现代计算语言学中受到的关注较少,尽管早期的人工智能工作探索了模态逻辑和认知逻辑以整合不确定性信息(Moore,1981(https://arxiv.org/html/2607.27405#bib.bib39)),而这正是广义上 AI 的一个基本问题。 虽然存在关于认知情态词语义及其推理的哲学和语言学文献(例如,Yalcin(2010(https://arxiv.org/html/2607.27405#bib.bib3));Kratzer(2012(https://arxiv.org/html/2607.27405#bib.bib5))),但在 NLP 中对其分析的工作较少。Holliday 等人(2024(https://arxiv.org/html/2607.27405#bib.bib6))在这一方向上迈出了重要一步,他们使用可由模态逻辑表示的 might 和 must,对 LLM 的模态推理进行了探测。他们发现了基本错误以及在不同相关推理类型之间逻辑不一致的判断,这与人们对 LLM 容易犯“貌似合理但无效”推理的担忧相呼应。 这与类似工作相呼应,这些工作发现 LLM 在三段论上的准确率很大程度上依赖于识别特定 token 模式,改变名称、实体或量词会导致可预测的性能变化(Jiang 等人,2024(https://arxiv.org/html/2607.27405#bib.bib9)),我们也将对此进行考察。EM 推理能力尤其重要,因为 EM 推理几乎在所有高 stakes 的自然语言场景中都是核心,而这些场景正是 LLM——在这些语境中通常俗称为 AI——可能被部署的地方:一个临床决策支持系统读到“治疗可能有效”或某人“可能患有某种疾病”的笔记时,必须在排序选项之前综合不确定性前提;一个法律文件分类系统必须区分“可能已经知道”和“可能知道”,因为两者具有不同的证据权重;而一条金融流程如果将“市场可能会复苏”视为等同于“市场一定会复苏”,则会错误描述风险。随着 LLM 被嵌入医疗、法律和金融领域的决策回路,它们正确处理涉及 probably、might 和 must 的推理的能力已成为一个实际问题,而不仅仅是理论问题。 我们的基准涵盖十五种模板,编码了十三种不同的推理模式(10 个有效,3 个无效),共 14,320 个提示。我们改变逻辑等价推理模式的措辞,以检查模型是基于 token 而非底层逻辑来改变其推理:我们使用五种提问形式(“Is it correct that...?”、“Is it true that...?”、“Does it follow that...?”等)、多种否定策略(前缀、not、命题层面)以及表层内容(来自七个国籍群体的名字、五种活动描述)。一个真正的推理者会在所有这些变化中给出相同的答案,无论词汇如何变化。我们评估了 29 个模型;大多数模型显示出对某一答案的固定偏差,即对“是”或“否”的系统性偏好,这种偏好跨越推理类型而存在,而不是追踪每个推理所允许的结论。 我们的主要贡献是:(1)一个数据集和基准,已在多种模型上测试,用于概率算子上的推理,它对固定的逻辑形式变化提问形式、极性和内容(动词和名词短语),从而将模型的答案偏差和模式匹配与原则性推理分离开来(§4(https://arxiv.org/html/2607.27405#S4));(2)强有力的证据表明,模型是根据固定的答案偏差而非逻辑推理来作答(29 个模型中只有 9 个超过随机基线),并且这一发现与否定无关(§4.1(https://arxiv.org/html/2607.27405#S4.SS1));(3)对否定句和非否定句的比较,揭示了在语义相同的问题上准确率差距高达 64 个百分点,从而将否定策略识别为基准设计中的一个混淆因素(§5.1.2(https://arxiv.org/html/2607.27405#S5.SS1.SSS2))。 ## 2 相关工作 为了提供该任务的理论背景,并将我们的工作置于先前关于评估 LLM 推理的文献中,我们回顾相关工作。 ### 2.1 LLM 中的模态和概率推理 先前关于认知情态词语义的工作为我们评估模型所用的推理模板提供了理论基础。Kratzer(1991(https://arxiv.org/html/2607.27405#bib.bib4),2012(https://arxiv.org/html/2607.27405#bib.bib5))建立了标准的量化框架;Lassiter(2011(https://arxiv.org/html/2607.27405#bib.bib1),2017(https://arxiv.org/html/2607.27405#bib.bib2))提出了概率替代方案,其中 probablyφ 意味着 p(φ) 很高,mightφ 意味着 p(φ) 是非平凡的,而 mustφ 意味着 p(φ) 接近最大;Yalcin(2010(https://arxiv.org/html/2607.27405#bib.bib3))关于概率算子的工作则编目了涉及认知比较级的有效和无效推理模式。 Holliday 等人(2024(https://arxiv.org/html/2607.27405#bib.bib6))使用条件句和情态助动词 might 与 must,测试了 29 个 LLM 在 20 种推理模式上的表现。他们发现所有模型都会犯基本谬误,并且即使他们研究中最强的模型(GPT-4,闭源)在不同相关模式之间也表现出逻辑不一致的判断(例如,接受带 must 的否定后件式,但拒绝带 might 的否定后件式,这在逻辑上是矛盾的)。他们的模板侧重于带条件句的情态助动词(might、must),而我们的工作则遵循 Yalcin(2010(https://arxiv.org/html/2607.27405#bib.bib3))的语义学工作,侧重于副词 probably,考察 LLM 在分级认知推理中的特定推理模式(例如,合取分配、条件句到比较级转换以及合取谬误)。 Li 等人(2025(https://arxiv.org/html/2607.27405#bib.bib44))进一步向 LLM 提供包含事实信息的短篇叙述,并用包含情态助动词 may/might 与 must/have to 以及态度动词(know、believe、doubt)的提示来询问 LLM。他们注意到准确率受提示格式的影响。我们的工作更注重还原,专注于简单模板而非复杂叙述。 Imannezhad 等人(2026(https://arxiv.org/html/2607.27405#bib.bib7))使用匹配的人类参与者档案,检查了 GPT-5 在合取谬误、析取谬误和二元互补性违反上的概率推理,认为 GPT-5 似乎具有一个一致的内部概率模型(我们的结果对此提出反驳),该模型与量子概率模型一致,并且优于人类。 他们在单一固定提示格式下引出数值概率评级,并发现其判断在内部是一致的。相比之下,我们保持推理固定而改变提问格式,发现二元判断会随公式化方式而变化。我们的模型组合主要是开放权重的,以便于可复现,同时包含少量前沿闭源模型作为参考点;我们没有评估 Imannezhad 等人所检验的商业 GPT-5 模型,我们的模型组合中最接近的是 GPT-5.4-mini。此外,与人类判断进行比较不同,我们的工作侧重于 LLM 推理本身的正确性。 Macmillan-Scott 和 Musolesi(2024(https://arxiv.org/html/2607.27405#bib.bib8))测试了七个 LLM 在心理学文献中的认知偏差任务上的表现,发现 LLM 是非理性的,但它们的非理性并不反映人类模式:当模型给出错误答案时,它们犯错的方式与人类不同。他们还发现响应存在显著不一致性,这与我们的发现一致,即这些任务上看起来像推理的很多行为实际上是表面驱动的答案行为,而非对命题的追踪。 ### 2.2 表面敏感性与 Token 偏差 LLM 的性能会随着不影响答案的表面形式变化而改变。Jiang 等人(2024(https://arxiv.org/html/2607.27405#bib.bib9))将此描述为“token 偏差”,并引入了一个使用 McNemar 检验(McNemar,1947(https://arxiv.org/html/2607.27405#bib.bib28))在匹配对上进行的假设检验框架。他们表明,在合取谬误和三段论问题上,保持逻辑不变而改变名称、实体或量词会产生可预测的性能变化,这表明模型依赖表层模式而非推理。类似地,Binz 和 Schulz(2023(https://arxiv.org/html/2607.27405#bib.bib10))发现 GPT-3(由于闭源,现已不可用)解决经典认知心理学小场景时“与人类被试相似或更好”,但“对基于小场景的任务进行微小扰动可能会让 GPT-3 严重偏离”。其他工作强调,即使是保持语义不变的格式变化(分隔符、标签样式)也会产生高达 76 个百分点的准确率波动(Sclar 等人,2024(https://arxiv.org/html/2607.27405#bib.bib11)),这与机器翻译中记录类似问题的工作相呼应(Shi 等人,2022(https://arxiv.org/html/2607.27405#bib.bib41))。此外,LLM 存在接受错误预设的倾向,使它们容易基于隐含的错误信息进行推理(Ermakova 等人,2026(https://arxiv.org/html/2607.27405#bib.bib12))。Sharma 等人(2024(https://arxiv.org/html/2607.27405#bib.bib30))直接挑战了关于 LLM 和大型推理模型“推理”能力的说法,证明前者在低问题复杂度下优于后者,但两者在更高问题复杂度下都会崩溃。 在扰动方面,我们的工作——它专注于三段论推理的一个特定但基础的角落——与先前的工作有几个不同之处。首先,先前工作中的扰动会改变问题所谈论的内容(名称、实体、量词)或文本在页面上的呈现方式(分隔符、标签样式)。我们也这样做,但同时还会改变提问方式,即替换元语言包装(Is it true that...,Does it follow that...)以及表达问题否定的方式,这是更接近逻辑结构本身的表面敏感性维度。我们还将准确率分解为正交组成部分(答案偏差和极性敏感性),超越了二元敏感性检测,而是衡量每个因素解释了多少。 ### 2.3 响应偏差与默认同意 Tjuatja 等人(2024(https://arxiv.org/html/2607.27405#bib.bib13))调查 LLM 是否表现出类似人类的响应偏差(默认同意、顺序效应、意见浮动)。他们测试了九个模型在 2,578 对问题上的表现,发现 LLM 通常不反映类人的偏差模式,并且 RLHF 降低了对偏差诱导修改的敏感性,同时增加了对非偏差扰动的敏感性。Braun(2025(https://arxiv.org/html/2607.27405#bib.bib14))将其扩展到 37,975 个以调查风格措辞的问题变体(“do you agree...”、“don't you agree...”),涉及英语、德语和波兰语法律领域文本上的分类任务,发现 LLM 在英语中表现出偏向回答“否”的倾向,这是人类默认同意偏差的反面。这与我们的结果一致:答案偏差的方向(是还是否)是模型依赖的,而非普遍的,一些模型强烈偏向“是”,另一些则强烈偏向“否”。 我们的基线取两种答案条件准确率中的最小值,而不是它们的平均值,因为仅平均值会掩盖偏差:当一个答案类别接近天花板而另一个接近地板时,平均准确率可能很高。基准的有效性-通过-否定结构正是使这个最小值具有信息量的原因,它提供了一个绝对基线,在此基线下,一个最大偏差的 LLM 无论有效/无效混合情况如何都会得 0 分。我们将其完整构建推迟到准确率指标的讨论中(§4.1(https://arxiv.org/html/2607.27405#S4.SS1))。 第三种评估框架将答案标签先验视为校准问题。Zhao 等人(2021(https://arxiv.org/html/2607.27405#bib.bib23))表明,使用语言模型进行少样本分类会受到多数标签、近因和常见 token 偏差的影响,并从无内容输入中估计模型的先验;Zhao 等人(2021(https://arxiv.org/html/2607.27405#bib.bib23))在推理时将其消除,获得了显著的准确率提升;Fei 等人(2023(https://arxiv.org/html/2607.27405#bib.bib25))使用领域内词汇细化了先验估计,Zhou 等人(2024(https://arxiv.org/html/2607.27405#bib.bib26))则使用测试批次上的平均预测进行细化。Holtzman 等人(2021(https://arxiv.org/html/2607.27405#bib.bib24))将相关扭曲追溯为相同答案的不同表面形式之间概率质量的分散。这些结果是在 2021 年至 2024 年间的模型上建立的;我们的模型组合表明该现象并未随时间消失,当前的指令微调和推理模型仍然带有极端的答案先验。我们的答案偏差是在“是/否”空间上的标签偏差,而该文献表明这类先验通常可以通过校准来消除。在那些工作将先验视为
相似文章
LLM置信度估计的不同方法基准测试
本文对LLM置信度估计的各种黑盒与白盒方法进行了基准测试,包括口头化置信度、语言不确定性、推理长度、P(Answer)、P(True)和自我一致性,比较它们在主动学习和安全分类等任务中的有效性。
易于完成,难以选择:探究LLM在ProverbIT基准上的表现
本文介绍了ProverbIT,一个包含100道多选题的新型意大利语基准,用于测试LLM完成谚语的能力。通过对13个模型的评估,研究发现,在没有正确答案的多选题格式中,模型性能显著下降,这表明模型依赖记忆模式而非深层的语义理解。
LLMEval-Logic:一个经过求解器验证的、带有对抗性加固的大语言模型逻辑推理中文基准
LLMEval-Logic 是一个新的中文基准,专门评估大语言模型的逻辑推理能力,具有求解器验证的答案和对抗性加固。该基准揭示了当前模型的显著差距,最佳模型在困难项目上仅达到37.5%的准确率。
行动之前:面向前瞻性假设发现的LLM基准测试
本文介绍了HypoArena,这是一个用于评估LLMs从非完整证据中主动构建假设空间能力的基准,在15个前沿LLM上的实验揭示了能力分层。
基准是否低估了 LLM 的性能?采用以大语言模型为先、人工仲裁的评估方法评估幻觉检测
本文通过采用以大语言模型为先、人工仲裁的评估方法重新评估幻觉检测数据集,研究了标准基准是否低估了大语言模型(LLM)的性能。研究发现,在仲裁过程中融入大语言模型的推理能力可以提高评估的一致性,并表明针对容易产生歧义的任务,采用模型辅助的重新评估能产生更可靠的基准。