未完成体悖论在大型语言模型中并非必然:模型失败前的基准测试失败
摘要
本文重新评估了针对大型语言模型的未完成体悖论基准测试,识别出概念和评估上的误规范,并引入了词汇匹配的最小对以揭示模型语义推理中的充分性偏差。
arXiv:2608.25005v1 公告类型:新
摘要:未完成体悖论为组合语义分析提供了一个有用的测试。近期研究构建了一个NLI基准测试,并报告称模型经常从进行体描述中推断出完成的终结性事件,将此行为归因于目的论偏差。它进一步认为提示干预会导致校准危机。我们重新审视该基准测试和结论,并表明其受到概念和评估误规范的显著影响。我们识别出三个概念误规范。特别是,体貌约减影响了基准测试的构建、分析、实验和结论。在严格的NLI标准下,76%的A组实例并未明确排除终结。在我们的母语者标注中,38%的A组示例和29%的C组示例被判定允许替代解释。为控制这些问题和词汇变异,我们构建了词汇匹配的最小对。在评估层面,我们将事件语义NLI形式化为一个多步推理问题,并评估中间语义决策和最终预测。我们的结果表明,模型通常并不肯定终结,但仍然接受相应的简单过去时假设,我们将此模式称为充分性偏差。我们进一步表明,提示干预在标签间产生决策偏移,而没有可靠地改进底层语义理解和推理。中间分析和引导分析识别出两种额外的失败模式:组合体貌分类中的错误和表面形式对表面关联答案的吸引。我们在Qwen-7B、GPT-5.4和Qwen-72B上使用适当提示的实验,为体貌分类的上下文敏感性提供了初步证据,并表明这些模型可以达到与人类标注者相当的性能。
查看缓存全文
缓存时间: 2026/08/27 09:13
# 未完整体悖论未必存在于大型语言模型中:模型失效前的基准失效
来源:https://arxiv.org/html/2608.25005
作者:Yizhou Sun
所属机构:加州大学洛杉矶分校
邮箱:[\{kqhan,yzsun\}@cs\.ucla\.edu](mailto:)
###### 摘要
未完整体悖论为组合语义分析提供了一项有效的检验。近期研究构建了一个自然语言推理基准,并报告模型常从进行时态描述中推断出已完成的目标导向事件,将此行为归因于目的论偏误。该研究进一步指出,提示干预会引发校准危机。我们重新审视了该基准及相关结论,发现其在概念设定与评估方法上存在显著缺陷。我们识别出三类概念设定问题,其中体貌还原尤为关键,它影响了基准的构建、分析、实验与结论。在严格的自然语言推理标准下,76%的A组实例并未明确排除事件完成的可能性。在我们的母语者标注中,38%的A组示例和29%的C组示例被判定为允许其他解释。为控制这些问题及词汇变异,我们构建了词汇匹配最小对立对。在评估层面,我们将事件语义推理表述为多步推理问题,并同时评估中间语义决策与最终预测。结果表明,模型常不肯定事件完成,却仍接受相应的简单过去时假设——我们将这一模式称为充分性偏误。我们进一步发现,提示干预仅导致标签间的决策偏移,未能可靠提升底层语义理解与推理能力。通过中间步骤与神谕引导分析,我们识别出另外两种失效模式:组合体貌分类错误,以及表面形式吸引效应。我们在适当提示下的Qwen-7B、GPT-5.4及Qwen-72B模型实验,为体貌分类的语境敏感性提供了初步证据,并表明这些模型可达到与人类标注者相当的性能。
## 1 引言
大量证据表明,在需要语义组合与多步推理的任务中,尤其是零样本、无引导、直接回答且不允许中间推理的设置下,较小的语言模型常依赖表层统计线索而非系统性的组合分析(Gururangan et al., 2018;McCoy et al., 2019;Kim and Linzen, 2020;Qiu et al., 2022;Wei et al., 2023;Press et al., 2023;Kojima et al., 2023;Suzgun et al., 2023;Kim et al., 2023)。未完整体悖论是检验此局限性的新试验场(Vallurupalli and Ferraro, 2025;Pruś et al., 2025;Ma and Miyao, 2026)。考虑句子“木匠在建造一个凉亭”,它并不蕴涵凉亭已建成。这种对于目标导向(完成性)谓词的蕴涵缺失即被称为未完整体悖论。相比之下,对于“跑步”这类非完成性谓词,事件本身即包含持续活动。因此,“男孩在跑步”蕴涵“男孩跑了”。近期研究认为大语言模型存在目的论偏误:倾向于推断目标导向事件必然达到其预期终点。研究利用自然语言推理基准对比“完成性与非完成性动词”,指出即使是先进的开源模型¹ 也常推断中断的完成性事件已完成。提示干预引发校准危机:思维链或强制反事实非终点等策略虽能减少幻觉性完成推断,但常过度矫正,导致模型错误拒绝对非完成性活动的有效蕴涵,这支持了模型难以根据事件类型动态调整推理的观点(Ma and Miyao, 2026)。
¹ 主要为7-9B参数模型,如Qwen2.5-7B-Instruct。
### 未完成体悖论与词汇体貌
- **完成性谓词**
前提:木匠在建造一个凉亭。→
假设:木匠建了一个凉亭。
蕴涵关系:未知
- **非完成性谓词**
前提:男孩在公园里跑步。→
假设:男孩在公园里跑了步。
蕴涵关系:真
- **谓词决定体貌**
前提:男孩在跑回家。→
假设:男孩跑回了家。
蕴涵关系:未知
虽然两个谓词均包含动词“跑”,但“跑”表示非完成性活动,而“跑回家”则表示完成性成就,因为“家”引入了内在终点。
本文认为,该基准及相关结论在很大程度上受到概念设定与评估方法缺陷的影响,需重新审视。我们首先识别出一个影响基准构建、评估与结论的根本问题:体貌还原。该基准基于孤立动词的体貌分类构建数据集、开展实验与分析,而词汇体貌实际上是完整谓词的组合属性。在基准层面,我们还识别出另外两个问题:一是语义设定问题,即将事件完成视为二元且与语境无关的条件;二是关系误赋,即将中断与未完成混淆。在严格的自然语言推理标准下,76%的A组实例未明确确立未完成性;在我们的母语者标注中,38%的A组示例和29%的C组示例被判定为允许其他解释。此外,原始基准混淆了组合体貌与不受控的词汇变异。为解决此问题,我们构建了词汇匹配最小对立对,仅改变论元或结果证据,保留其余词汇与句法语境。
现有评估将事件语义推理压缩为直接的句子对分类问题,现有提示则为这些步骤提供不完整、不清晰或有时误导的指导。因此,我们将事件语义自然语言推理表述为多步推理框架。利用该框架,我们重新审视了所述目的论偏误,并识别出一种不同的失效模式:模型常不肯定事件完成,却仍预测相应的简单过去时假设被蕴涵。这表明模型未必幻觉事件完成,而是表现出充分性偏误:将事件发生视为接受完成性简单过去时谓词的充分条件。此外,所报告的校准危机可能主要源于提示改变了模型对输出标签的偏好,却未提升其底层语义理解与推理能力。我们将此现象称为决策偏移。
最后,我们利用多步推理框架分析所观察到的错误如何揭示语言模型对未完整体悖论的理解。我们评估最终答案所依据的中间语义判断,并使用神谕引导设置分离不同错误来源。这些错误反映了体貌误分类与表面形式吸引效应。我们在GPT-5.4与Qwen2.5-72B上的实验,为大型模型体貌分类的语境敏感性提供了初步证据,且其性能与人类标注者在基准标准下具有可比性。
我们的贡献总结如下:
- 识别并量化了三类基准设定缺陷:体貌还原、语义设定问题与关系误赋,并构建了有效性筛选子集作为敏感性分析辅助工具;
- 重新审视了目的论偏误与校准危机的证据,揭示了充分性偏误这一替代解释,并指出校准危机主要源于提供不完整、不清晰甚至误导性指导的提示;
- 通过构建词汇匹配最小对立对,控制词汇变异,分离了组合体貌与词汇关联;
- 将事件语义推理表述为多步推理过程,引入中间输出与神谕引导评估,定位体貌误分类与表面形式吸引两类错误。
## 2 相关工作
### 2.1 体貌分类与解释变异
Vendler根据动词谓词的时间属性区分了四种体貌类别:状态、活动、达成与完成。尽管原始讨论基于动词,但“跑”与“跑一英里”等对比表明,体貌类别取决于完整谓词而非孤立动词。Filip明确了这一组合观点,认为完成性不能归结为动词本身的语义或句法信息,而是通过动词与论元及其他句子成分的互动产生的(Vendler, 1957; Filip, 1999)。即使有明确的中断语境,许多完成性事件仍表现出显著的人际分歧(Pruś et al., 2025)。虽然非完成性谓词通常对进行时到简单时的蕴涵判断较为一致,但完成性谓词则表现出异质模式,包括偏向是、偏向否及双峰响应。这表明完成性仅对人类判断提供粗略预测:一个进行中事件是否被视为蕴涵完成事件,还取决于具体谓词、可能的中断场景及世界知识(Pruś et al., 2024)。人类判断在理论归类为完成性的谓词中也存在显著差异。尽管理论上完成性谓词的进行时不应蕴涵完成事件,但仅4/30的完成性动词被强烈判断为不蕴涵。相比之下,参与者主要判断进行时蕴涵完成事件的比例为:10个完成性-瞬时谓词中的2个,以及20个完成性-持续谓词中的12个(Pruś et al., 2024)。
### 2.2 未完整体悖论基准
CoRE通过比较模型对进行时与完成时事件描述的判断来评估未完整体悖论,涵盖有无叙事语境的情况²。结果显示语境并未一致提升性能,表明模型对体貌区分的敏感性有限(Vallurupalli and Ferraro, 2025)。
² 包括Mistral-7B、Llama-3.1-8B、Llama-3.1-70B与GPT-4o。
未完整体悖论基准通过2×2设计组织示例,交叉谓词完成性与语境结果信息(如方框2.2所示)。动词首先分为编码内在终点的完成性达成与非完成性活动。每类再配以“中断”语境或结果未明确的进行时语境,形成四组:中断的达成(A组)、中断的活动(B组)、歧义的达成(C组)与歧义的活动(D组)(Ma and Miyao, 2026)。
#### 未完整体悖论基准
**A组:中断的达成(完成性+取消)**
前提:木匠在建造一个凉亭,但暴风雨在封顶前摧毁了框架。
假设:木匠建了一个凉亭。
标签:假
**B组:中断的活动(非完成性+停止)**
前提:运动员们在跑道上跑步,但开始下冰雹。
假设:运动员们在跑道上跑了步。
标签:真
**C组:歧义的达成(完成性+过程)**
前提:木匠在建造一个凉亭。
假设:木匠建了一个凉亭。
标签:未知
**D组:歧义的活动(非完成性+过程)**
前提:运动员们在跑道上跑步。
假设:运动员们在跑道上跑了步。
标签:真
## 3 概念设定缺陷
我们识别出三类概念设定缺陷:(1)体貌还原:基于动词层面启发式分配体貌类别,而非谓词层面的组合分析;(2)语义设定问题:以过于刚性的规范终点定义事件完成,或某些谓词允许非完成性与完成性双重解读;(3)关系误赋:在自然语言推理标注中将中断映射为矛盾。这些问题系统性地影响了模型行为的评估。
#### 三类基准设定缺陷
**(1) 体貌由谓词层面决定**
前提:男孩在跑回家。
假设:男孩跑回了家。
尽管词汇动词“跑”常被视为活动动词,但谓词“跑回家”包含目标论元,描述一个有界事件。因此,为“跑”分配固定体貌类别忽视了完整谓词的组合语义。
**(2) 完成性可能依赖语境**
前提:约翰吃了一个苹果,只留下极小的一块。
假设:约翰吃了一个苹果。
自然语言谓词并不要求理论终点的完全实现。对于增量主题谓词,语境中可忽略的剩余部分可能与通常的完成判断兼容。
**(3) 中断不意味未完成**
前提:木匠在建造一个凉亭,但雨导致停工一天。
假设:木匠建了一个凉亭。
中断既未确立最终完成,也未确立最终未完成。若无后续信息,假设应为中立,而非矛盾。
### 3.1 体貌还原
首要问题在于基准对词汇体貌的表征。体貌类别并非孤立动词的固定属性,而是由完整谓词(包括动词、论元、量化属性、路径或目标表达式及其他句法成分)组合决定的。因此,同一词汇动词可参与不同相似文章
基准评估:评估小语言模型的自动化安全基准
本文评估了小语言模型的自动化安全基准,发现判断中的高度模糊性损害了可靠性,并揭示了能力-安全性混淆。
校准与决策:重新审视未学习语言模型中的可靠性悖论
本文重新审视了语言模型机器遗忘背景下的可靠性悖论,证明模型在依赖基于捷径的决策规则的同时能够实现较低的校准误差,从而将该悖论扩展至未学习模型。
语言模型如何失败:承诺性与持续性推理失败的词元级特征
本文通过词元级不确定性信号,刻画了语言模型在推理中失败的两种不同过程——承诺性失败与持续性不确定性,并展示了其对自一致性及失败检测策略的启示。
“不太可能”有多不可能?评估大型语言模型对言语概率的感知
本文对大型语言模型如何解释言语概率表达式进行了系统性的跨模型评估,发现它们能够忠实追踪人类基准,但存在偏差,尤其是在负面表达方面,这对人类与AI之间的不确定性交流有影响。
当可解码性不足时:语言模型中的逻辑有效性表示、行为分离与因果测试
本文研究了大型语言模型如何内部表示逻辑有效性,表明尽管行为表现不佳,有效性信息仍可从隐藏状态中解码,这表明表示、表达和因果使用具有不同的作用。