在子十亿参数语言模型中,实体跟踪能力涌现,并在自然叙事中超越人类表现
摘要
本文通过使用自然叙事研究语言模型和人类中的实体跟踪能力,发现子十亿参数的模型已达到人类水平并超越人类,表明核心语言理解能力在比先前假设更小的规模上涌现。
arXiv:2608.18083v1 Announce Type: new
摘要: 理解语言需要在话语中跟踪实体——即知道事物的位置和变化,即使没有明确陈述。语言模型是否以类似人类的方式执行此类跟踪仍不明确,部分原因是现有评估依赖于与自然语言理解相去甚远的人工任务,并且缺乏与人类的比较。在此,我们使用多个复杂程度的自然叙事评估语言模型和人类(N = 48)的实体跟踪能力。在人类中,我们发现实体跟踪能力特异性地随着叙事复杂性而下降,而非叙事长度。在语言模型中,我们发现人类水平的实体跟踪能力在4.1亿参数时已经存在——远低于先前工作确定的数十亿参数、代码专用模型——并且随着规模提高,当代模型远超人类表现。综上所述,这些结果表明,实体跟踪作为语言理解的核心组成部分,在比先前认为小得多的模型规模上涌现。
查看缓存全文
缓存时间: 2026/08/20 09:49
# 实体追踪在亚十亿参数语言模型中涌现,并在自然叙事中超越人类表现 来源:https://arxiv.org/html/2608.18083 Micha Heilbron2,3 1IDEAS 研究所;波兰,华沙 2马克斯·普朗克心理语言学研究所;荷兰,奈梅亨 3阿姆斯特丹大学,阿姆斯特丹大脑与认知中心;荷兰,阿姆斯特丹 [email protected], [email protected] ###### 摘要 理解语言需要在话语中追踪实体——即,了解事物在哪里以及它们如何变化,即使未被明确陈述。语言模型是否以类似人类的方式进行此类追踪仍不清楚,部分原因是现有评估依赖于远离自然语言理解的人工任务,且缺乏与人类的比较。本文使用不同复杂度的自然叙事,评估了语言模型和人类(N=48)的实体追踪能力。我们发现,人类的实体追踪能力特定于叙事复杂度(而非叙事长度)而下降。在语言模型中,我们发现,达到人类水平的实体追踪能力在4.1亿参数时已出现——远低于先前工作识别出的数十亿参数、专门化代码模型——并且随着规模扩大而提升,当代模型的表现远超人类。这些结果共同表明,作为语言理解核心组成部分的实体追踪能力,其涌现的模型规模远小于先前认为的。 实体追踪在亚十亿参数语言模型中涌现,并在自然叙事中超越人类表现 Karolina Drożdż1 和 Micha Heilbron2,3 1IDEAS 研究所;波兰,华沙 2马克斯·普朗克心理语言学研究所;荷兰,奈梅亨 3阿姆斯特丹大学,阿姆斯特丹大脑与认知中心;荷兰,阿姆斯特丹 [email protected], [email protected] **图 1:概念概览。左:语言理解需要在叙述展开时,在话语上下文的内部模型中*追踪实体*。右:在人类(上)中,实体追踪准确性随情境复杂度下降;在语言模型(下)中,我们发现了类似的模式,并且能力随规模增长而提升。** ## 1 引言 大型语言模型(LLM)的流畅性重新引发了一个长期存在的问题:产生连贯文本的能力是否意味着真正的语言理解,还是可以通过复杂的模式匹配来模仿(Bender 和 Koller, 2020;Shanahan, 2024)?实现这一问题的一个方法是询问语言模型(LM)是否像人类理解者一样*在话语中追踪实体*——即,在叙述展开时,维护和更新指称物底层状态、位置和关系的表征(Groenendijk 和 Stokhof, 1991;Heim, 2002;Zwaan 和 Radvansky, 1998)。关键的是,其中许多状态从未被明确提及,必须基于对文本意义的连贯内部模型,从所描述的事件中推断出来。例如,如果一个故事描述了一把钥匙从一个只装有一把钥匙的盒子中取出,理解者会立即推断盒子现在是空的,尽管这从未被明确提及(Li 等人, 2021)。那么,那些表现出明显理解能力的语言模型,在多大程度上真正像一个真正的理解者那样追踪实体呢? 先前的工作已开始从多个角度解决这个问题。首先,有影响力的探针工作表明,实体状态可以从编码器-解码器模型激活中线性解码(Li 等人, 2021),尽管后续工作揭示,大多数报告的准确性源自平凡情况而非真正的实体追踪(Kim 和 Schuster, 2023)。通过分析模型输出,Kim 和 Schuster(2023);Kim 等人(2024)发现,稳健的实体追踪仅在大规模、在海量专门化代码数据集上预训练的模型中出现。 然而,一些限制使得从这项工作中得出的结论变得复杂。首先,尽管有证据表明人类经常依赖浅层的、“足够好”的策略,而不是构建完全详细的情境模型(Ferreira 等人, 2002),但没有研究比较模型表现与人类表现。因此,人类在多大程度上可靠地在叙述中追踪实体是一个实证问题,这对于解释模型表现至关重要。其次,先前评估中使用的任务高度程式化和人工化——例如,“盒子 0 包含画作,盒子 1 包含铃铛,盒子 2 包含吉他,……将玻璃杯从盒子 6 移动到盒子 4。……”(Kim 和 Schuster, 2023;Kim 等人, 2024)——这使得这些任务更接近解决推理谜题或执行程序,而非理解自然语言。因此,这些研究报告的参数和数据要求可能反映的是任务的需求,而非实体追踪本身的局限。 在本研究中,我们解决了这两个局限。我们开发了一个受控的实验范式,其中简短的叙述——程序化生成但自然可读——描述了五个情境复杂度级别下的场景。实体追踪通过显式(基于生成)和隐式(强制选择或概率读出)方法进行评估,使得在匹配条件下、不同任务需求下比较人类和模型成为可能(Hu 和 Frank, 2024)。我们评估了两个完全开源的模型家族在不同规模下的表现——Pythia(70M–12B)和 OLMo 2(1B–32B)——以及更大的当代模型(Llama 3.3、Qwen 2.5),并将它们的表现与人类(N=48)在相同刺激上的表现进行比较。为了评估模型表现是否反映真正的追踪还是依赖分布先验,我们还在包含伪词和语义上不可能出现物体的叙述上测试了所有模型。 我们报告了四个发现。首先,人类的实体追踪能力特定于情境复杂度而下降,揭示了维持结构化情境模型存在认知复杂度成本。其次,语言模型中的实体追踪能力在远小于先前报告的规模上涌现:稳健的、人类水平的追踪能力在4.1亿参数时已存在,且能力随规模可预测地提升,复杂度的影响随着模型增长而减弱,并在70B规模的当代模型中完全消失。第三,指令微调选择性地提升了显式但非隐式实体追踪,表明基础表征能力在基础模型对齐之前就已存在。第四,表现对标准、伪词和语义上不可能出现的物体类型均稳健,表明模型是通过话语结构而非词汇关联来稳健地追踪实体。 这些结果共同表明,作为真正语言理解核心组成部分的实体追踪能力随着模型规模而涌现,其出现的参数量远低于先前认为的,并且在足够大的规模下,语言模型可以远远超越人类的表现。 除了实证发现,我们还分享了我们的评估范式,使研究人员能够在无需任务特定微调的情况下,研究小型完全开源基础模型中的自然实体追踪111代码可在我们的代码库中获取 (https://anonymous.4open.science/r/entity_tracking_EMNLP-A842)。. ## 2 相关工作 生成模型是否构建了其训练领域(即所谓的“世界模型”)的结构化内部表征,这一点已在许多领域进行了广泛研究,例如游戏或行星运动等真实情况完全确定的人工领域。总体而言,这类表征的证据在各领域并不一致。一方面,在 Othello 落子序列上训练的模型发展出支持预测甚至在不可达游戏状态下的内部棋盘状态表征(Li 等人, 2022;Nanda 等人, 2023)。另一方面,在城市导航上训练的 Transformer 尽管预测近乎完美,却包含空间上不连贯的内部地图(Vafa 等人, 2024);并且在行星轨迹上训练的模型未能恢复真实的、底层的牛顿力学(Vafa 等人, 2025)。总之,在此类封闭领域中,完美的下一词预测并不意味着完美的内部模型。 对于自然语言,语言模型是否构建连贯的“情境模型”并动态追踪实体状态这一问题,已在表征和机制层面进行了探讨。Prakash 等人(2024)专注于实体追踪任务的一个简化版本(无状态变化),识别出基础语言模型中实现实体追踪的回路,并表明微调增强了这些通路。研究专门在排列组合上训练的 Transformer 时,Li 等人(2025)发现了用于实体追踪的结构化并行算法(关联扫描)。这证实了计算机制存在于 Transformer 中,但并未说明这是否在语言理解中被使用,或者它是否从自然语言预训练中涌现。 最直接的先前评估来自 Kim 和 Schuster(2023),他们使用了前面描述的盒子与物体任务,发现高达1750亿参数的纯文本模型完全失败;追踪能力首次仅在 GPT-3.5(一个封闭的、专门化代码的模型)中出现。Kim 等人(2024)将其扩展到开源权重模型家族,在130亿参数且包含5000亿额外代码词元时发现稳健追踪,或者在仅70亿参数但代码训练更广泛(2万亿词元)时发现。然而,两者都在这种人工的、程序化的任务上评估模型,并且缺乏与人类的比较——这使得它们的发现是否能推广到构成自然叙述理解的那种情境模型构建成为悬而未决的问题。我们的工作同时解决了这两个局限。 ## 3 方法 ### 3.1 任务设计 我们开发了一个新颖的实体追踪任务,参与者和模型在不同复杂度的简短叙述中追踪物体在不同位置间的移动。每个叙述后附有一个问题,探测目标物体的最终位置(叙述示例见附录 D (https://arxiv.org/html/2608.18083#A4))。 **图 2:实验设计概览。上图显示了一个简化复杂度为 3 的叙述,包含两个目标物体(F0, F1)。下图显示了两种评估格式:一种是显式的开放式回忆任务(左),要求生成被评估物体的正确最终位置;另一种是隐式任务(右),对人类参与者以强制选择形式呈现,对语言模型则以概率读出形式比较正确与错误的延续。关于不同复杂度级别的完整叙述示例,见附录 D (https://arxiv.org/html/2608.18083#A4)。** **复杂度。** 复杂度由需要追踪的物体、位置和移动数量定义。构建了五个级别:C1 涉及一个物体在一个位置;C2 涉及一个物体在两个位置间移动;C3 涉及两个物体在三个位置间;C4 涉及三个物体在三个位置间交错移动;C5 涉及四个物体在四个位置间。人类参与者接受了 C1–C4 的测试,因为试点数据表明 C4 已带来巨大的认知负荷;语言模型还额外接受了 C5 的测试。 **评估格式。** 由于显式问答可能系统性地低估模型能力(Hu 和 Frank, 2024),我们同时使用了显式和隐式评估格式。对于模型,显式条件要求自由生成,而隐式条件利用直接的概率读出。相应地,对于人类参与者,显式和隐式条件分别由开放式生成和强制选择组成(见图 2 (https://arxiv.org/html/2608.18083#S3.F2))。 **近因控制。** 由于更高复杂度的叙述也更长,这引入了一个潜在的混淆因素:准确性的下降可能反映的是近因效应,而非复杂度本身。为了解决这个问题,我们在较长的叙述中改变了目标物体的位置(即,焦点物体 F0–F3)。这使我们能够评估表现是否取决于物体最近被提及的程度,从而区分基于近因的回忆与追踪多个实体的需求。如果表现由近因驱动,那么最近提及的物体应产生更高的准确性;相反,在不同位置上表现稳定则表明依赖于整合的表征而非表面层次的回忆。 ### 3.2 刺激材料 所有叙述均使用自动化流水线生成。这使得能够系统化和可扩展地构建保证在训练数据中未逐字出现的新颖刺激。生成的叙述被设计为自然而非僵硬或人工化,遵循固定的事件结构以保持连贯性。物体、位置和角色在每个实例中随机采样,确保试次间的多样性。 为了阻止参与者采用策略性搜索物体位置——而非构建连贯的情境模型——我们引入了轻微的词汇变异(例如,约 30% 的句子中包含描述性形容词),并穿插了 10 个填充试次,这些试次包含结构不同的叙述和针对一般故事细节的理解问题。 **模板变体。** 为了评估对语义先验的依赖,我们构建了三种模板条件:(i)标准,使用所述情境中常见的物体;(ii)伪词,使用由 Wuggy(Keuleers 和 Brysbaert, 2010)生成的、形式匹配的可发音非词;以及(iii)不可能出现,使用语义上不一致或抽象的实体(Wang 等人, 2018)(见附录 B (https://arxiv.org/html/2608.18083#A2))。由于利用训练数据分布的混淆因素对语言模型是特有的,因此它们需要对抗性评估来证明稳健的追踪能力。因此,虽然人类基线仅使用标准模板建立,但模型在所有三种模板上进行了评估,以测试它们的表现是否反映了一种可推广的机制,而不仅仅是语义合理性。 ### 3.3 人类评估 **样本。** 我们通过 Prolific 招募了 48 名母语为英语的参与者,并支付了报酬(平均年龄 = 40.8,标准差 = 12.9;24 名男性,20 名女性,4 名未透露)。数据收集方案获得了阿姆斯特丹大学社会与行为科学学院伦理审查委员会的批准。
相似文章
基础模型在AI检测器中像人类
一项研究发现,基础语言模型在AI检测器中看起来像是人类写的,而经过指令微调的模型则不然。作者提出了一种名为HIP的改写管道,该管道能在不同模型规模下提高文本的人类相似度,同时保持语义。
人类认知与行为的小型基础模型
本文在Psych-101数据集上训练了14个小语言模型(参数规模从1.35亿到140亿),该数据集包含来自160个实验的1070万次逐试次人类选择。研究发现,小型模型足以匹配分布内数据,而大型模型在分布外泛化方面表现更好。诊断结果表明,遮蔽刺激和反馈会破坏大部分已学信息,表明仅凭选择历史是不够的。
Transformer语言模型中情境建模与心理化的发育轨迹
本文研究了Transformer语言模型在不同训练阶段中情境建模与心理化能力的涌现,发现错误信念任务的表现依赖于模型大小和训练量,在预训练后期才出现,并且在非事实性动词下表现出脆弱性。
使用大型语言模型标注实体匹配的训练数据
本文研究使用大型语言模型作为教师模型来标注实体匹配的训练数据,结果表明,在机器标注数据上训练的学生模型与在人工标注基准上训练的模型性能相当,并且具有显著的成本和速度优势。
赋予角色的大型语言模型表现出类似人类的动机推理
本文研究了为大语言模型赋予角色是否会引发类似人类的动机推理,发现赋予角色的大语言模型真实性辨别能力最多下降9%,并且以与其诱导的政治身份一致的方式评估科学证据的可能性最多增加90%,而基于提示的去偏见方法基本无效。