自动还是控制?重复启动揭示基础大语言模型、指令大语言模型和人类的不同处理方式
摘要
本文应用重复启动来展示基础大语言模型使用自动处理,而指令模型表现出控制处理,人类则显示混合特征。
arXiv:2608.14681v1 Announce Type: new
摘要:在自然语言使用中,词语不断重现,但尚不清楚语言模型是重新激活先前的表示还是重新评估重复的词语,以及训练后是否改变这种默认行为。我们应用重复启动(Shiffrin和Schneider,1977)于五个模型家族(参数1.5B-14B)中的15个模型,在两个任务中:语义分类和完形填空,使用相同的刺激物进行匹配的人类实验。我们发现基础模型表现出自动处理:它们显示出立即的促进效应,在不同间隔下保持稳定,部分在上下文移除后仍存在,并与对先前出现的注意力相关。指令模型表现出控制处理:它们的促进效应随间隔衰减,在没有预期上下文时消失,在更大规模下反转为干扰。在Qwen 2.5家族内,这种分离随着模型规模单调增加,表明训练后逐渐改变重复处理。人类显示出混合特征,具有间隔敏感的促进效应,类似于指令模型但没有干扰,表明两种模型类型都未能完全捕捉人类认知。我们的发现揭示了训练后语言模型处理重复信息的质的转变,并为模型行为之间的分歧提供了机制证据。
查看缓存全文
缓存时间: 2026/08/18 09:48
# 自动还是受控?重复启动揭示基础大语言模型、指令大语言模型与人类的不同加工模式 来源:https://arxiv.org/html/2608.14681 任景磊 耶鲁大学医学院 [email protected] 与 王越月 加州大学洛杉矶分校计算机科学系 [email protected] ###### 摘要 词汇在自然语言使用中不断重复出现,但语言模型是重新激活先前的表征,还是重新评估重复出现的词汇,以及后训练是否会改变这种默认行为,目前尚不清楚。本文将重复启动(Shiffrin和Schneider, 1977 (https://arxiv.org/html/2608.14681#bib.bib42))应用于5个模型家族(15亿至140亿参数)的15个模型,进行两项任务(语义分类和填空补全),并采用相同刺激材料设计了匹配的人类实验。我们的研究发现:(1) 基础模型表现出*自动加工*特征,呈现出即时的、跨间隔稳定的促进效应,部分效应在移除上下文后仍然存在,并直接关联于对先前出现的关注度;(2) 指令模型表现出*受控加工*特征,其促进效应随间隔衰减,在缺乏预期上下文时消失,并且在更大规模模型中反转为干扰效应;(3) 在通义千问(Qwen)2.5系列(15亿-140亿)中,这种分离随模型规模单调扩大,表明后训练逐步抑制了自动促进效应;(4) 人类表现出混合特征,既像指令模型那样对间隔敏感,又像基础模型那样保持统一的促进效应,从未反转为干扰效应。本研究表明,后训练流程与模型加工重复信息的方式发生了质变有关,为两种模式分歧的机制提供了证据,并揭示人类认知处于两种模型类型都未能捕捉的中间地带。 ## 1 引言 词汇在自然语言使用中反复出现,包括在多轮对话、重叠的检索段落以及重复的少样本示例中(Brown等人, 2020 (https://arxiv.org/html/2608.14681#bib.bib15); Ouyang等人, 2022 (https://arxiv.org/html/2608.14681#bib.bib46))。当语言模型在当前上下文中遇到一个已经处理过的词汇时,它只是重新激活先前的表征,还是会重新评估该词汇?我们提供证据表明,答案与后训练相关,包括监督指令微调以及对某些模型进行的偏好优化。基础模型默认采用快速重新激活的方式:重复一个词汇无论间隔上下文如何都能促进加工。指令模型则进行依赖上下文的重新评估:促进效应随间隔衰减,并且在大规模模型中反转为干扰效应。这种差异不仅仅是量级上的,而是反映了两种质上不同的加工模式。 为了刻画这些机制,我们借鉴了认知心理学中*自动加工与受控加工*的框架(Shiffrin和Schneider, 1977 (https://arxiv.org/html/2608.14681#bib.bib42))。自动加工快速、受刺激驱动且抗干扰;受控加工较慢、依赖上下文且易受干扰破坏。重复启动是人类心理语言学中一个成熟的范式(Scarborough等人, 1977 (https://arxiv.org/html/2608.14681#bib.bib16); Forster和Davis, 1984 (https://arxiv.org/html/2608.14681#bib.bib19); Tenpenny, 1995 (https://arxiv.org/html/2608.14681#bib.bib30)),它提供了一种可控的方式来探究这些机制:通过改变重复暴露之间的间隔,我们可以检验促进效应是持久且受刺激驱动的,还是短暂且易受上下文干扰的。近期研究已开始将双过程框架应用于大语言模型行为,将快速启发式反应到审慎推理的转变描述为从系统1到系统2的过渡(Brady等人, 2025 (https://arxiv.org/html/2608.14681#bib.bib43); Li等人, 2025 (https://arxiv.org/html/2608.14681#bib.bib44); Ziabari等人, 2025 (https://arxiv.org/html/2608.14681#bib.bib45)),但这主要是通过提示操纵实现的。我们采取了不同的方法:利用重复启动来证明后训练流程与默认加工模式的质变有关。 我们测试了5个家族、5个参数规模(15亿–140亿参数)的15个模型,进行了两项互补实验:*语义分类*(实验1),探究重复暴露如何影响强制选择分类;以及*填空补全*(实验2;Taylor, 1953 (https://arxiv.org/html/2608.14681#bib.bib36); Peelle等人, 2020 (https://arxiv.org/html/2608.14681#bib.bib12)),探究重复暴露如何促进在弱约束上下文中的开放性词汇检索。匹配的基础/指令模型变体提供了家族内的受控对比,在公共检查点允许的范围内尽可能保持架构和预训练家族一致。对于每项实验,我们都使用相同刺激和设计进行了匹配的人类实验。 在两项任务中,我们都发现了一致的解离现象。基础模型表现出强烈、即时的促进效应,该效应跨间隔稳定且对中间材料稳健。指令模型表现出较弱的促进效应,该效应随间隔衰减,并且在更大规模模型中反转为干扰效应——同一个词在之前帮助模型,现在却伤害了它。这不是微妙的量级差异,而是两种加工模式之间的质变,表明指令微调不仅重塑了模型*输出什么*,而且从根本上改变了它们*如何*加工重复信息。 三个机制性探针支持这一解释:移除先前响应上下文在基础模型中产生残留促进效应,但在指令模型中产生干扰;重新映射分类标签显示基础模型有部分迁移,指令模型则没有;并且消融与先前出现检索相关的注意力头仅在基础模型中显著减少了启动效应。综合这些结果表明,基础模型的启动效应至少部分是在词汇层面且受刺激驱动的,而指令模型的启动效应更依赖于下游的上下文评估。在受控的通义千问2.5系列(15亿-140亿)中,这种分离随规模单调扩大。匹配的人类实验揭示了第三种特征:像指令模型一样对间隔敏感,但又像基础模型一样保持统一的促进效应,从未反转为干扰效应。 ## 2 相关工作 ### 2.1 上下文学习与重复 上下文学习(ICL)使模型无需参数更新即可根据提示示例调整行为(Brown等人, 2020 (https://arxiv.org/html/2608.14681#bib.bib15)),机制研究识别了基于注意力的检索过程,如归纳头(Olsson等人, 2022 (https://arxiv.org/html/2608.14681#bib.bib17)),并将ICL描述为隐式优化(Dai等人, 2023 (https://arxiv.org/html/2608.14681#bib.bib22); Akyürek等人, 2023 (https://arxiv.org/html/2608.14681#bib.bib39))。ICL研究关注从结构化示例中的*任务级*适应;我们研究的是跨越中间材料的*项目级*重复。间隔操纵将持久的项目特定效应与短期的近因效应区分开来(Min等人, 2022 (https://arxiv.org/html/2608.14681#bib.bib18); Zhao等人, 2021 (https://arxiv.org/html/2608.14681#bib.bib38); Liu等人, 2022 (https://arxiv.org/html/2608.14681#bib.bib40))。相关地,Vaidya等人(2023 (https://arxiv.org/html/2608.14681#bib.bib47))发现人类和语言模型在预测重复文本时存在差异,将语言模型重复与注意力头和近因效应联系起来。我们受控的设计分离了重复词汇项的加工结果,并比较了匹配的基础/指令检查点。 ### 2.2 语言模型中的启动效应 *语义启动*研究报告了人类和模型在相关词汇促进效应上的部分对应(Ettinger等人, 2016 (https://arxiv.org/html/2608.14681#bib.bib23); Misra等人, 2020 (https://arxiv.org/html/2608.14681#bib.bib24)),而*结构启动*研究表明对近期句法结构的复用(Sinclair等人, 2022 (https://arxiv.org/html/2608.14681#bib.bib25))。重复启动则关注*相同的*词汇。Mahaut和Franzon(2025 (https://arxiv.org/html/2608.14681#bib.bib48))表明,生成中的自然重复和ICL诱导的重复依赖于不同的机制,在置信度、注意力分配和对扰动的敏感性上有所不同。他们的任务关注生成性重复;我们的任务关注受控的重复项目加工。两项结果都表明,表面上相似的重复效应可能源于不同的机制。我们使用人类重复启动研究的诊断工具包和自动/受控框架(Shiffrin和Schneider, 1977 (https://arxiv.org/html/2608.14681#bib.bib42))来刻画后训练如何转变默认的加工模式。 ### 2.3 指令微调的影响 已知指令微调会重塑模型行为,超越表面的顺从性(Ouyang等人, 2022 (https://arxiv.org/html/2608.14681#bib.bib46))。Wu等人(2024 (https://arxiv.org/html/2608.14681#bib.bib4))表明,指令微调调整自注意力头以捕捉指令相关关系,并将前馈表示旋转向用户导向的任务,这表明发生了深层的表征变化,而不仅仅是表面的格式调整。基础和指令变体的比较揭示了系统性的行为差异:基础模型在检索增强生成设置中优于指令模型(Cuconasu等人, 2024 (https://arxiv.org/html/2608.14681#bib.bib5)),指令微调模型表现出改进的知识获取能力(Jiang等人, 2024 (https://arxiv.org/html/2608.14681#bib.bib2)),而指令模型表现出增强但更脆弱的任务遵循行为。这些发现引发了我们的问题:指令微调是否也改变了模型在项目级别处理重复信息的方式?我们提供证据表明确实如此,将默认模式从自动加工转变为受控加工。关于双过程框架、大语言模型-人类认知比较以及神经科学中重复抑制的扩展相关工作见附录A (https://arxiv.org/html/2608.14681#A1)。 ## 3 实验1:语义分类 ### 3.1 模型 我们测试了15个模型,涵盖5个家族和5个参数规模(表1 (https://arxiv.org/html/2608.14681#S3.T1))。在70-80亿参数规模,我们测试了LLaMA 3 (80亿)、Mistral (70亿) 和通义千问2.5 (70亿),每个都有基础和指令变体。我们还测试了Gemma 2 (20亿,基础和指令) 和Phi-4 (140亿,仅指令)。为了研究扩展性,我们在四个规模上测试了通义千问2.5:15亿、30亿、70亿和140亿(每个规模都有基础和指令版本)。 所有模型均以bfloat16精度运行,并使用eager注意力机制以提取注意力矩阵。 表1:测试的模型(15个模型,5个家族)。通义千问2.5系列跨越四个参数规模,便于分析模型规模如何与指令微调相互作用以影响信息处理。 ### 3.2 刺激材料与设计 我们从McRae等人(2005 (https://arxiv.org/html/2608.14681#bib.bib26))的特征规范中选择了182个具体名词,在有生命实体(91个)和无生命物体(91个)之间平衡。45个非目标具体名词用作填充词,按类别平衡(22个有生命,23个无生命);填充词在目标词的间隔窗口内不重复。对照分析表明,相同类别填充词的比例不能预测目标启动效应(β=0.02, SE=0.05, t=0.41, p=.68),也不改变暴露和间隔效应。 每个目标词出现4次(暴露E1–E4),相邻暴露之间由间隔条件决定的固定数量的填充试验(1、3、7或15个间隔试验)。每个间隔条件作为单独的会话运行,在每个目标词首次暴露前重置上下文,确保启动效应仅反映词内重复。这种项目内设计使我们能够测量从E1(基线)到后续暴露的加工变化。 ### 3.3 流程与测量 在每次试验中,模型收到一个零样本分类提示,被要求将一个词汇分类为“有生命”或“无生命”。遵循Petroni等人(2019 (https://arxiv.org/html/2608.14681#bib.bib28)),我们测量对数概率差: 对数概率差 = log P(正确) − log P(错误) (1) 启动效应(我们的关键指标,衡量重复暴露如何改变信息加工)计算为: 启动效应Ei = 对数概率差Ei − 对数概率差E1 (2) 正值表示促进;负值表示干扰。 ### 3.4 实验1a:大语言模型结果 #### 启动幅度。 所有7个基础模型在最后一次暴露(E4−E1)时都显示出强烈、统一的正启动效应(范围:+5.04 至 +6.89,所有 p < .001;表7 (https://arxiv.org/html/2608.14681#A8.T7);图1 (https://arxiv.org/html/2608.14681#S3.F1))。指令模型较弱且变异更大:大多数表现出中等促进效应,但有两个表现出干扰效应(Mistral-Instruct 和 Qwen2.5-14B-Instruct;见表7 (https://arxiv.org/html/2608.14681#A8.T7))。 #### 间隔特征。 为估计暴露次数和间隔对启动幅度的联合效应,我们为每个模型单独拟合了一个线性混合效应模型。 Mij = β0 + β1 Expi + β2 Lagj + (1 + Expi | Word) + εij (3) 其中 Mij 是对数概率差,Expi 是序数暴露,Lagj 是间隔项目数,(1 + Expi | Word) 允许基线难度和重复敏感性因项目而异。所有7个基础模型都显示出正的暴露效应(所有 p < .001)且无间隔效应。八个指令模型中有六个在未校正阈值下显示出负的间隔效应;五个在FDR校正后仍然显著。因此,促进效应随间隔衰减,并且在Qwen2.5-14B-Instruct中反转为干扰效应(表8 (https://arxiv.org/html/2608.14681#A8.T8))。 #### 规模趋势。 通义千问2.5系列(15亿、30亿、70亿、140亿)提供了我们模型集中唯一的连续匹配规模系列(图2 (https://arxiv.org/html/2608.14681#S3.F2))。在该系列内,基础模型的启动效应跨规模稳定,而指令模型的启动效应单调下降,并在140亿规模反转为干扰效应。我们并不从通义千问内的模式推断规模单独解释了跨家族的差异。 参见图注图1:实验1在不同间隔条件和暴露下的启动特征。基础模型和指令模型在单独的放大面板中显示;蓝色表示促进,红色表示干扰。数值暴露均值和拟合的间隔系数见附录表7 (https://arxiv.org/html/2608.14681#A8.T7)和表8 (https://arxiv.org/html/2608.14681#A8.T8)。参见图注图2:实验1规模趋势(通义千问2.5)。最终启动效应(E4−E1)对基础模型稳定,但对指令模型下降。误差线:标准误。 ### 3.5 实验1b:人类实验 为了将大语言模型的发现锚定于人类认知,我们使用40名英语母语者进行了一项匹配的语义分类实验,采用完全相同的刺激材料和设计。该实验的详细结果见附录B,但为完整起见,我们在此报告核心发现:人类参与者表现出强烈的促进效应(最终启动效应:+5.21,p < .001),该效应随间隔衰减(间隔的负面效应:-0.12,p = .02),但从未反转为干扰效应——这与基础模型的稳定促进和指令模型在大规模下的反转形成鲜明对比。这种“中间”特征(间隔敏感但始终促进)是人类特有的,两种模型类型均未完全捕捉。
相似文章
LLM中的条件性认知偏差:有偏见的用户轮次如何调节上下文推理
本文引入了一个三条件实验框架和一个包含24,300个提示的基准,研究在多轮交互中,有偏见的用户轮次如何调节前沿LLM中的认知偏差表达。研究发现,在大多数模型中,有偏见的对话上下文会放大偏差,而明确的偏差线索可能触发与对齐相关的抑制行为。
出于必要性的偏差:收敛式人工智能与人类验证中顺序处理的不可能性定理
本文证明了不可能性定理,表明由于因果掩码(causal masking)约束,首要效应(primacy effects)、锚定效应(anchoring)和顺序依赖性(order-dependence)是自回归语言模型中架构上必然存在的偏差。作者跨越12种前沿大语言模型验证了这些理论界限,并通过涉及工作记忆负荷的预注册人类实验证实了相关预测。
评估 LLM 在受控实验中作为人类代理的可靠性
本论文通过比较 LLM 生成的数据与人类在准确性感知调查中的反应,评估现成 LLM 是否能可靠地模拟受控行为实验中的人类反应。研究发现,虽然 LLM 能捕捉方向性效应和聚合信念更新模式,但它们的效应大小与人类尺度不一致,这有助于澄清合成 LLM 数据何时可以作为行为代理。
查询时机导致LLMs与人类产生相反的位置偏差
本文研究了查询时机如何影响LLMs与人类相比的位置偏差(首因效应和近因效应),发现LLMs会根据被查询的时间表现出相反的偏差,且较新的模型显示出更严重的效应。
在LLM个性化中重新聚焦人类
本文研究了在评估LLM个性化的三个阶段(属性提取、相关性匹配和响应生成)中,合成数据与人类数据之间的差距。结果表明,模型在真实人类数据上表现更差,作者引入了轻量级训练干预措施以改善对齐。