大型语言模型中的类人回指消解

arXiv cs.CL 论文

摘要

本文研究了五个开放权重的大型语言模型在回指消解中是否表现出对心理语言学因素的人类类似敏感性,使用惊奇度和理解准确率作为行为指标。结果显示选择性认知对齐:一些模型在回指消解中匹配了人类的话语敏感性,但对语义干扰效应的敏感性较弱或缺失。

arXiv:2608.05630v1 公告类型:新 摘要:回指词是指向其他表达(称为先行词)的表达。将两者连接起来的过程称为消解。认知科学已经确定了影响回指消解速度和成功率的多个因素,包括话语结构、情境模型属性和语义因素。在此,我们研究了这些因素是否也会影响五个开放权重的大型语言模型(LLM)中的回指消解:GPT-2-XL、Llama-3.1-8B、Pythia-12B、Mistral-7B 和 Mistral-24B。为了建模处理难度,我们采用标准链接假设,将人类阅读时间与模型在回指词处的惊奇度联系起来。作为第二个行为指标,我们将模型在探测回指词先行词的理解问题上的准确性与人类准确性进行比较。结果显示了选择性认知对齐:一些 LLM 在回指消解中表现出对话语显著性和距离因素的人类类似敏感性,而对语义干扰效应的敏感性较弱或缺失。这些发现限定了 LLM 接近人类回指消解的条件。
查看原文
查看缓存全文

缓存时间: 2026/08/07 07:51

# 大型语言模型中类人回指消解

来源:https://arxiv.org/html/2608.05630
vchinta6rajsanjayshahvarma\}@gatech\.edu 佐治亚理工学院![[未附图注图片]](https://arxiv.org/html/2608.05630v1/cropped-buzz-logo.png)

###### 摘要

*回指*(Anaphors)是指代其他表达(称为*先行词*,antecedents)的表达。将两者联系起来的过程称为*消解*(resolution)。认知科学已经发现了影响回指消解速度与成功率的多个因素,包括语篇结构、情境模型属性以及语义因素。在此,我们研究了这些因素是否也会影响五个开放权重大型语言模型(LLMs)中的回指消解,这些模型包括:GPT-2-XL、Llama-3.1-8B、Pythia-12B、Mistral-7B 和 Mistral-24B。为了对处理难度进行建模,我们采用了标准的连接假设,该假设将人类阅读时间与模型在回指处的惊讶度(surprisal)联系起来。作为第二个行为测量指标,我们将模型在探测回指先行词的阅读理解问题上的准确性与人类准确性进行了比较。结果显示存在选择性的认知对齐:一些 LLM 在回指消解中表现出类似人类对语篇显著性和距离因素的敏感性,而对语义干扰效应的敏感性较弱或缺失。这些发现限定了 LLM 近似人类回指消解的条件。

关键词:回指消解;情境模型;大型语言模型;惊讶度;认知对齐

††脚注文本:用于复现所有模型评估、分析和图表的代码可在以下网址获取:github\.com/wristy/anaphor (https://github.com/wristy/anaphor)。

## 引言

大型语言模型(LLMs)是在大型文本语料库上训练的深度神经网络,拥有数百万或数十亿参数。基于 Transformer 的架构,从 BERT[7 (https://arxiv.org/html/2608.05630#bib.bib10)] 和 GPT-2[27 (https://arxiv.org/html/2608.05630#bib.bib38)] 开始,一直延伸到较新的家族,如 GPT[24 (https://arxiv.org/html/2608.05630#bib.bib55)]、Llama[10 (https://arxiv.org/html/2608.05630#bib.bib15)] 和 Mistral[20 (https://arxiv.org/html/2608.05630#bib.bib56)],在语言理解任务上表现出色[35 (https://arxiv.org/html/2608.05630#bib.bib52)]。除了任务表现之外,这些模型越来越多地被评估为人类认知的候选模型[13 (https://arxiv.org/html/2608.05630#bib.bib19),26 (https://arxiv.org/html/2608.05630#bib.bib37),30 (https://arxiv.org/html/2608.05630#bib.bib41)],更具体地说,是作为人类语言处理的模型[2 (https://arxiv.org/html/2608.05630#bib.bib57),16 (https://arxiv.org/html/2608.05630#bib.bib24)]。

许多现有的将 LLM 作为认知模型进行评估的工作都集中在单词和句子层面的现象上,在相对局部和去语境化的语言环境中检验模型行为。这就留下了一个悬而未决的问题:LLM 是否能捕捉在扩展文本中展开的语篇层面过程。回指消解就是这样一种过程:它需要跨句子维持和检索信息,将语言输入与发展中的情境模型整合起来,并解决来自竞争指称对象的干扰。对这些需求的建模超越了局部预测,而是需要对连贯文本的敏感性。在序列语言模型中,预期词概率的变化(通常操作化为惊讶度)已被证明可以追踪人类阅读时间,从而在模型预测与人类理解行为之间提供了过程层面的联系[36 (https://arxiv.org/html/2608.05630#bib.bib53),16 (https://arxiv.org/html/2608.05630#bib.bib24)]。

尽管对认知对齐的兴趣日益增长,但对文本和语篇层面现象的关注却相对较少。当前研究通过聚焦于回指消解来弥补这一空白。它关注*回指*,即指代其他表达(称为*先行词*)的表达。代词是一类常见的回指;更一般地说,语言中充满了指称表达。在在线理解过程中,将回指与其先行词联系起来的过程称为*消解*。当回指和先行词出现在同一句子内或相隔几个句子时,消解可能很容易;在这种情况下,消解只需要搜索工作记忆[6 (https://arxiv.org/html/2608.05630#bib.bib9)]。然而,在阅读较长的文本时,回指可能与其先行词相隔许多句子。在这种情况下,消解需要将回指用作记忆线索,并试图从读者的情境模型中检索其先行词,情境模型是文本整体意义不断发展的表征[19 (https://arxiv.org/html/2608.05630#bib.bib29),33 (https://arxiv.org/html/2608.05630#bib.bib46)]。

认知科学研究已经调查了影响人类回指消解速度和准确性的因素。例如,回指与其先行词之间的句子数量越多,阅读速度就越慢,这大概是因为读者必须在其记忆中“搜索”更远的文本。阅读时间是一种衡量标准;另一种衡量标准是理解问题的准确性。继续上面的例子,句子数量越多,人们在回答关于先行词的理解问题时就越不准确,这大概是因为消解失败的可能性更大。在这里,我们询问 LLM 是否对人类理解者在回指消解过程中敏感的相同因素也敏感。在某种程度上,如果 LLM 做到了这一点,它们作为认知科学中语篇层面语言处理的候选模型就能获得更多可信度[13 (https://arxiv.org/html/2608.05630#bib.bib19),30 (https://arxiv.org/html/2608.05630#bib.bib41)]。

### 回指消解的认知科学研究

当前研究聚焦于认知科学确定的六个影响回指消解速度和准确性的因素。

第一个因素是文本的主题特征:如果先行词被*话题化*(topicalized),那么它应该在读者的情境模型中更突出,因此在遇到指向它的回指时应该更容易被获取。在这种情况下,消解应该相对快速且准确。话题化先行词有多种方式。例如,[23 (https://arxiv.org/html/2608.05630#bib.bib33)] 操纵了先行词是否被文本标题聚焦。第二个因素涉及文本本身的表面特征:回指与先行词之间的*句子距离*(即句子数量)越大,消解的速度越慢且准确性越低[4 (https://arxiv.org/html/2608.05630#bib.bib6)]。[23 (https://arxiv.org/html/2608.05630#bib.bib33)] 正交地变化了这两个因素,即先行词话题性和句子距离,实验 1 在该研究的材料上运行 LLM。

第三个和第四个因素不涉及表面距离,而是*情境*距离。当读者理解文本时,他们会构建一个描述故事世界的模型,这个模型被称为情境模型、心智模型或世界模型[19 (https://arxiv.org/html/2608.05630#bib.bib29),33 (https://arxiv.org/html/2608.05630#bib.bib46)]。第三个因素是读者情境模型中回指与先行词之间的*空间距离*(即感知到的物理距离)[21 (https://arxiv.org/html/2608.05630#bib.bib31),28 (https://arxiv.org/html/2608.05630#bib.bib39)]。第四个因素是两者之间的*时间持续时间*(即感知到的时间流逝)[1 (https://arxiv.org/html/2608.05630#bib.bib1),34 (https://arxiv.org/html/2608.05630#bib.bib48),37 (https://arxiv.org/html/2608.05630#bib.bib54)]。空间距离越大、时间持续时间越长,回指消解就越慢且越不成功。以下文本展示了一个相对较长的时间持续时间:

> 先行词:机械师踢了*金属椅子*。持续时间(长):花了*2小时*开车回家并带着关键工具返回。回指:之后,他为自己在沮丧时踢了*金属家具*而感到愚蠢。

[1 (https://arxiv.org/html/2608.05630#bib.bib1)] 发现,与相对较短的时间持续时间的文本相比,读者在阅读回指时相对较慢,在回答关于先行词的后续理解问题时准确性也较低:

> 机械师出于沮丧踢了哪件*金属家具*?

相对较短的时间持续时间:

> 持续时间(短):花了*10分钟*开车回家并带着关键工具返回。

第五个和第六个因素涉及读者构建的情境模型的语义。回指与先行词之间的*语义相似性*是指它们彼此的相似程度:相似性越高,回指作为从情境模型中检索先行词的记忆线索就越好。回到上面的例子,*椅子*是*家具*类别的典型成员[29 (https://arxiv.org/html/2608.05630#bib.bib40)]。因此,两者具有很高的语义相似性,这将加速消解。相反,如果先行词是非典型的(例如,*凳子*),这将减慢消解[9 (https://arxiv.org/html/2608.05630#bib.bib14),34 (https://arxiv.org/html/2608.05630#bib.bib48)]。接下来,考虑如果文本中出现了*家具*类别的另一个成员,而它不是先行词:

> 干扰项:机械师走过*木桌*,走向门口。

如果它是同一类别的典型成员,如上面的例子,那么这会在情境模型中搜索正确先行词(即*椅子*)时引起*语义干扰*,这将减慢消解速度并损害其准确性。相反,如果非先行词的干扰项是非典型的(例如,*木架子*),那么这应该只有很小的有害影响[5 (https://arxiv.org/html/2608.05630#bib.bib8),34 (https://arxiv.org/html/2608.05630#bib.bib48)]。

### LLM 中的回指消解

语言模型与人类理解之间的过程层面联系通常通过惊讶度来建立,惊讶度已被证明在多种句法和语义现象中与人类阅读时间相关[11 (https://arxiv.org/html/2608.05630#bib.bib16),15 (https://arxiv.org/html/2608.05630#bib.bib22)]。虽然基于惊讶度的分析已广泛应用于单词和句子层面,但它们在评估诸如回指消解等语篇层面过程中的使用仍然有限[36 (https://arxiv.org/html/2608.05630#bib.bib53),16 (https://arxiv.org/html/2608.05630#bib.bib24)]。

在早期工作中,[12 (https://arxiv.org/html/2608.05630#bib.bib59)] 和 [14 (https://arxiv.org/html/2608.05630#bib.bib60)] 评估了早期 LLM(例如 BERT、GPT-2)在同一句子内解析反身代词回指先行词的能力,即使在这种简单情况下结果也是好坏参半。更有希望的是,[25 (https://arxiv.org/html/2608.05630#bib.bib61)] 评估了 BERT 在句子距离增加的情况下解析回指的能力。他们识别出较高层中架起回指与其先行词之间桥梁的注意力头,尽管这些连接在较长距离(6−10 个句子)下较弱。他们还使用完形填空程序在回指位置探测模型对先行词的最佳猜测,发现在很近的句子距离(即≥3 个句子)下准确性也很低。

最近的工作考察了 LLM 解析回指和共指关系的能力,要么直接提示它们,要么使它们适应现有基准。这些研究显示模型、数据集和提示表述之间存在显著差异,通用 LLM 通常不如专门的共指系统[3 (https://arxiv.org/html/2608.05630#bib.bib4),17 (https://arxiv.org/html/2608.05630#bib.bib26)]。此外,报告的性能提升可能对数据集伪影、词汇启发式和近因偏差敏感,这引发了关于高准确性是否反映稳健的语篇理解还是浅层统计线索的问题[22 (https://arxiv.org/html/2608.05630#bib.bib32),8 (https://arxiv.org/html/2608.05630#bib.bib12)]。

更重要的是,高共指准确性并不意味着类似人的处理方式。现有的评估实践依赖不一致的指标,缺乏评估 LLM 生成响应的标准框架,特别是在跨数据集和任务表述的情况下[31 (https://arxiv.org/html/2608.05630#bib.bib44)]。标准 NLP 基准不会操纵或分离认知科学已证明控制回指消解的因素,例如语篇显著性、基于距离的可及性、语义相似性或来自竞争指称对象的干扰。因此,现有的评估无法区分那些使用表面启发式解决回指的模型与那些表现出对塑造人类理解的认知约束敏感性的模型[13 (https://arxiv.org/html/2608.05630#bib.bib19),30 (https://arxiv.org/html/2608.05630#bib.bib41)]。

*与其提出新的基准或优化共指性能,本研究采用经典认知科学范式作为评估框架。我们使用惊讶度和理解准确性作为互补的行为代理,询问 LLM 是否对塑造人类回指消解的相同语篇、情境和语义因素表现出敏感性。*

这种框架使我们能够超越正确的指称识别来评估认知对齐,而是专注于模型是否对影响人类读者的相同处理因素敏感。

参见图注图 1:作为先行词话题性和句子距离函数的回指处平均惊讶度(实验 1)。误差条是跨 16 个文本计算的标准误。参见图注图 2:作为先行词话题性和句子距离函数的平均理解问题准确性(实验 1)。误差条是标准误。

### 研究问题

我们评估 LLM 是否对上述六个已被证明会影响人类回指消解的因素敏感。特别是,我们测试当先行词由于更大的语篇显著性、更短的句子、空间或时间距离、更高的语义相似性以及更少的来自竞争指称对象的干扰而更容易获取时,消解是否得到促进。

我们使用五个开放权重 LLM(GPT-2-XL、LLaMa-3.1-8B、Pythia-12B、Mistral-7B 和 Mistral-24B)来解决这个问题。为了评估过程层面的敏感性,我们采用标准的连接假设,将模型在回指处的惊讶度与人类阅读时间联系起来[11 (https://arxiv.org/html/2608.05630#bib.bib16),15 (https://arxiv.org/html/2608.05630#bib.bib22),36 (https://arxiv.org/html/2608.05630#bib.bib53),16 (https://arxiv.org/html/2608.05630#bib.bib24)]。为了评估消解成功度,我们还测量了模型在文本处理之后探测回指先行词的理解问题上的准确性。

## 实验 1

实验 1 研究了(1)主题特征(先行词是否被文本标题话题化)和(2)文本特征(回指与先行词之间的句子距离,即间隔句子数量)对回指消解时间和准确性的影响。

### 设计与材料

材料来自 [23 (https://arxiv.org/html/2608.05630#bib.bib33)]。共有 16 个文本,每个文本通过正交变化两个因素形成四个版本。一个因素是句子距离(近、远),先行词出现在回指之前的 M= 5.6 或 M= 15.2 个句子处。

相似文章

大型语言模型有多像人类?一个关注语域的语言评估框架

arXiv cs.CL

本文提出了一种关注语域的语言评估框架,通过使用最大均值差异(MMD)比较人类与LLM生成文本中67个词汇语法特征的分布,来评估大型语言模型(LLM)的人类相似度。在七个经过指令微调的开源模型和五个语域上的实验表明,没有模型能完美匹配人类基线,且与人类语言的接近程度因语域而异,而非模型规模。

赋予角色的大型语言模型表现出类似人类的动机推理

arXiv cs.CL

本文研究了为大语言模型赋予角色是否会引发类似人类的动机推理,发现赋予角色的大语言模型真实性辨别能力最多下降9%,并且以与其诱导的政治身份一致的方式评估科学证据的可能性最多增加90%,而基于提示的去偏见方法基本无效。