焦点粒子与人类和语言模型中的标量推断

arXiv cs.CL 论文

摘要

本文比较了人类和LLM在不同响应量表配置下对含有焦点粒子“even”和“only”的句子的标量判断,发现了稳定的语义驱动差异,但注意到模型缺乏响应变异性。

arXiv:2608.08227v1 公告类型:新 摘要:诸如“even”和“only”之类的焦点粒子是形式语义理论的核心,这些理论假定对备选项集合进行结构化表征。“even”突出意外的或极端的备选项,而“only”则强制排他性。如果此类标量表征是稳健且可泛化的,它们应当在各种语境和系统中产生一致的判断。在这项工作中,我们测试了人类和大型语言模型(LLM)是否能从包含这些粒子的句子中构建稳定的标量表征。使用大约100个项目的数据集,参与者被要求进行标量判断。初步结果表明,人类和LLM之间的相似输出可能源于不同的底层机制。
查看原文
查看缓存全文

缓存时间: 2026/08/11 08:07

###### 摘要

我们比较了人类和大型语言模型对包含焦点粒子 even 和 only 的句子所做的标量判断,这些判断涉及四种在空间格式和标签映射上有所不同的反应量表配置。人类与LLM在各项配置之间均表现出 even 与 only 之间的稳定差异,这表明标量判断主要由语义结构而非空间组织驱动。尽管该模型再现了总体行为模式,但其缺乏反应变异性,这引发了关于LLM作为人类认知模型适用性的疑问。

## 1 引言

理解人类和人工系统如何解释结构化意义是认知科学和自然语言处理中的核心问题。诸如 even 和 only 这类对焦点敏感的粒子,清楚地展示了小型功能词如何系统地重塑对当前备选集合的解释。这些表达并不改变句子的核心命题内容,而是通过引入关于什么是惊人的、典型的或排他的预期来修改其推断意义。例如,even 倾向于突出意外或低概率的备选项,而 only 通过限制有效备选项的集合来引入排他性。

然而,目前尚不清楚由此产生的标量评估是反映空间组织的数量表征,还是反映更一般的、基于效价的机制。一种理论提出,标量判断根植于空间编码,例如抽象数量被映射到左右或上下等空间维度[1](https://arxiv.org/html/2608.08227#bib.bib11)。按照这种观点,反应选项的空间配置应系统性地影响判断。另一种理论源自极性对应原理,该原理提出,当刺激的概念极性与反应映射的极性一致时,表现会得到促进[5](https://arxiv.org/html/2608.08227#bib.bib16)。从这个角度来看,even 和 only 之间的差异在不同的空间配置中应大致保持稳定,因为判断主要受评价性和语言结构驱动,而非空间数量表征。

最近的研究表明,LLM 会发展出结构化的语言信息内部表征[3](https://arxiv.org/html/2608.08227#bib.bib7),这引发了这些系统是否表现出与人类相似的行为模式的问题。在本研究中,我们考察人类和语言模型在不同反应量表配置下解释包含 even 和 only 的句子时,是否会给出相似的能力判断。在各项条件下,我们同时操纵量表方向和空间格式,以检验标量判断是受空间对齐还是受语言与评价性结构的系统性影响。与人类不同(人类的空间表征是由与物理世界的具身互动塑造的),基于 transformer 的语言模型通过双向注意力同时处理文本输入词元[9](https://arxiv.org/html/2608.08227#bib.bib6),因此反应量表的空间方向可能不会像对人类那样映射到方向性表征上。因此,比较人类和模型的反应可以检验相似的标量判断是来自共同的表征原理,还是来自不同的底层机制。

## 2 方法

我们创建了60个描述人们执行与能力相关任务的句子(例如,“Mike can bake a cake.”)。其中30个句子包含粒子 even,另外30个句子包含 only。人类参与者(N=108)完成了四项 Qualtrics 研究中的一项。我们沿两个维度操纵了反应量表的空间配置:空间格式(水平 vs. 垂直)和标签映射(标准 vs. 反转)。在标准映射条件下,低能力出现在左侧(垂直布局中为底部),高能力出现在右侧(垂直布局中为顶部)。在反转映射条件下,这些标签被翻转。这些操纵产生了四种实验条件:水平-标准、水平-反转、垂直-标准和垂直-反转。在每次试验中,参与者阅读一个目标句子,并在5点李克特量表上对该个体进行评分。

语言模型数据使用 Llama 3.3 70B[8](https://arxiv.org/html/2608.08227#bib.bib5) 收集,这是一个700亿参数的开源自回归语言模型,通过 Groq API 访问(模型字符串:llama-3.3-70b-versatile)。每个刺激句子都以模仿人类调查结构的方式呈现在提示中,包括反应量表配置。模型被指示根据所描述人物的隐含能力,用1到5之间的单个整数作答。为了从模型的反应分布中采样,每个提示在温度为1.0的条件下运行20次,在60个句子和4种量表条件下共产生4,800个观测值。

## 3 结果

评分使用线性混合效应模型进行分析,其中粒子类型(Even vs. Only)、来源(Human vs. LLM)、格式(Horizontal vs. Vertical)和映射(Standard vs. Reversed)为固定效应,参与者和项目为随机截距。模型显示粒子类型的主效应显著(β=2.20,SE=0.09,p<.001),粒子类型与来源的交互作用显著(β=1.38,SE=0.03,p<.001)。人类对 even 句子的平均评分为2.07,对 only 句子的平均评分为4.31,而LLM产生了更极端的评分(分别为1.41和5.00)。对估计边际均值的后续比较显示,人类和LLM对 only 句子的评分均高于 even 句子(p<.001)。然而,LLM的粒子间差异(3.58)大于人类(2.20)。

这些发现表明,人类和LLM都对与 even 和 only 相关的标量含义敏感。在各项条件下,even 句子与较低的能力判断相关,而 only 句子与较高的能力判断相关。关键在于,改变反应量表的方向或标签映射并未消除或逆转这种模式,这表明标量判断主要由粒子的语义和评价性内容驱动,而非反应量表的空间排列。这一模式为标量判断的评价性解释提供了比空间编码解释更有力的支持。与此同时,LLM产生了比人类参与者更极端的判断。特别是,only 句子在每项观测的所有条件下都被赋予了最高评分,这表明该模型以比人类更绝对化的方式对待 only 的含义,而人类则表现出更多分级的反应。

参见图1:按粒子和反应量表配置划分的人类和LLM能力评分。误差线:95%置信区间;LLM在 only 条件下无误差线,因为所有反应均相同。

## 4 讨论

尽管LLM再现了人类行为的定性模式,但它在两个方面与人类行为存在分歧。首先,它的判断更为极端,在100%的 only 试验中都给出了量表最高评分,并且在 even 试验中也表现出比人类参与者显著更低的变异性。其次,尽管采样温度为1.0(通常被认为会产生类似人类的反应变异性),重复采样却产生了高度一致的反应。温度只能向模型已有的反应分布中添加随机性;当模型的概率几乎全部集中在单一反应上时,重复采样往往会返回相同的反应。

与此观点一致,并遵循先前的研究[7](https://arxiv.org/html/2608.08227#bib.bib1),[6](https://arxiv.org/html/2608.08227#bib.bib2),对部分项目进行的后续温度扫描显示,在0.0到2.0的采样温度范围内(每个项目、条件和温度下采样20次),模型反应在标准和反转量表映射下都保持高度稳定。这种模式表明,仅提高温度不足以产生类似人类的反应变异性。因此,对模型进行多次采样并不等同于采样许多人类参与者;一个模型多次运行之间的变异性反映的是围绕单一固定判断的噪声,而人与人之间的变异性反映的是解释上的真正个体差异。事实上,已有研究表明,选择合适的采样温度仍然是一个未解决的挑战[2](https://arxiv.org/html/2608.08227#bib.bib3),[4](https://arxiv.org/html/2608.08227#bib.bib4)。

鉴于个体差异是人类行为的一个决定性特征,我们模拟中缺乏变异性进一步引发了对当前LLM作为人类认知模型适用性的质疑。更广泛地说,这与近期的发现一致,即当代LLM无法再现人类群体中观察到的变异性广度,即使在平均任务表现和总体反应模式匹配良好的情况下也是如此[6](https://arxiv.org/html/2608.08227#bib.bib2)。

## 参考文献

- [1]S. Dehaene, S. Bossini, and P. Giraux (1993) The mental representation of parity and number magnitude..Journal of experimental psychology: General122(3),pp. 371. 引用:§1 (https://arxiv.org/html/2608.08227#S1.p2.1).
- [2]W. Du, Y. Yang, and S. Welleck (2025)Optimizing temperature for language models with multi-sample inference.arXiv preprint arXiv:2502.05234. 引用:§4 (https://arxiv.org/html/2608.08227#S4.p2.1).
- [3]D. Kryvosheieva, A. de Varda, E. Fedorenko, and G. Tuckute (2025)Different types of syntactic agreement recruit the same units within large language models.arXiv preprint arXiv:2512.03676. 引用:§1 (https://arxiv.org/html/2608.08227#S1.p3.1).
- [4]L. Li, L. Sleem, Y. Xu, Y. Song, A. Jia, J. Francois, and R. State (2026)The necessity of setting temperature in llm-as-a-judge.arXiv preprint arXiv:2603.28304. 引用:§4 (https://arxiv.org/html/2608.08227#S4.p2.1).
- [5]R. W. Proctor and Y. S. Cho (2006)Polarity correspondence: a general principle for performance of speeded binary classification tasks..Psychological bulletin132(3),pp. 416. 引用:§1 (https://arxiv.org/html/2608.08227#S1.p2.1).
- [6]M. Qiu, Z. Brisebois, and S. Sun (2025)Can llms simulate human behavioral variability? a

相似文章

大型语言模型中的类人回指消解

arXiv cs.CL

本文研究了五个开放权重的大型语言模型在回指消解中是否表现出对心理语言学因素的人类类似敏感性,使用惊奇度和理解准确率作为行为指标。结果显示选择性认知对齐:一些模型在回指消解中匹配了人类的话语敏感性,但对语义干扰效应的敏感性较弱或缺失。

大型语言模型有多像人类?一个关注语域的语言评估框架

arXiv cs.CL

本文提出了一种关注语域的语言评估框架,通过使用最大均值差异(MMD)比较人类与LLM生成文本中67个词汇语法特征的分布,来评估大型语言模型(LLM)的人类相似度。在七个经过指令微调的开源模型和五个语域上的实验表明,没有模型能完美匹配人类基线,且与人类语言的接近程度因语域而异,而非模型规模。

前沿大型语言模型的响应漂移

arXiv cs.CL

一项针对10个前沿大语言模型、涵盖62个问题的大规模人类评估发现,所有模型都表现出响应漂移,其中大多数模型收敛到78-81%的偏差上限,而两个模型实现了较低的偏差。漂移程度因领域和问题而异,自动指标几乎无法解释人类判断,这凸显了人类评估的必要性。