语言模型知道不该说什么吗?LLMs中统计抢占的因果证据
摘要
本文提供了因果证据,表明大型语言模型通过微调操纵竞争形式频率,能够获得统计抢占(构式语法中的一种机制)所涉及的负面语言知识(即不该说什么),且行为变化符合预测方向。
arXiv:2605.23039v1 公告类型:新
摘要:学习者如何在没有负面证据的情况下获得关于不可接受语言的知识?构式语法提出了统计抢占机制:接触常规形式(例如,“donated the books to the library”)会抢占结构上可能但未经验证的替代形式(“*donated the library the books”)。我们提出了一项计算研究,首次在单一收敛设计中直接区分了大型语言模型中的统计抢占与竞争固化假说。通过涵盖120个英语动词-构式配对(与格、使役、处所)的四项实验,我们表明:(1)LLM的惊奇度模式与人类可接受性判断高度相关(r = 0.79),并在三个独立行为数据集上得到验证;(2)这些模式由竞争形式频率驱动,而非总体动词频率,并通过非循环偏相关得到确认;(3)抢占敏感度随模型规模呈幂律增长;(4)受控微调干预因果性地表明,操纵竞争形式频率会导致抢占行为向预测方向变化,而反向控制则排除了频率敏感性混淆。这些结果提供了汇聚证据,表明神经语言模型通过分布竞争——构式语法所假设的核心机制——获得负面语言知识。
查看缓存全文
缓存时间: 2026/05/25 08:57
# 语言模型知道什么不该说吗?关于大语言模型中统计抢先的因果证据 来源:https://arxiv.org/html/2605.23039 郭东欣 香港大学 香港,中国 bettyguo@connect\.hku\.hk & 吴吉坤 Stellaris AI Limited 香港,中国 hk950014@connect\.hku\.hk & 姚思明 香港大学 香港,中国 smyiu@cs\.hku\.hk ###### 摘要 学习者如何在缺乏负面证据的情况下获得关于不可接受形式的知识?构式语法提出了*统计抢先*(statistical preemption):接触一种常规形式(如“*donated the books to the library*”)会抢先于结构上可能但未获证实的替代形式(“*\*donated the library the books*”)。我们提出了一项计算研究,首次在大型语言模型中通过单一收敛设计直接区分统计抢先与竞争性的固着化假设(entrenchment hypothesis)。跨越四个实验,涵盖120个英语动词–构式配对(与格、使役、处所),我们发现:(1) LLM 的 surprisal 模式与人类可接受性判断高度相关(r=0.79),经三个独立行为数据集验证;(2) 这些模式由竞争形式的频率而非整体动词频率驱动,通过非循环偏相关系数得以确认;(3) 抢先敏感性随模型规模呈幂律增长;(4) 一次受控的微调干预在因果上表明,操纵竞争形式的频率会按预测方向改变抢先行为,而反向控制排除了频率敏感性混淆。这些结果提供了收敛的证据,表明神经语言模型通过分布竞争获得负面语言知识——这正是构式语法所提出的核心机制。 # 语言模型知道什么*不该*说吗?关于大语言模型中统计抢先的因果证据 郭东欣 香港大学 香港,中国 bettyguo@connect\.hku\.hk 吴吉坤 Stellaris AI Limited 香港,中国 hk950014@connect\.hku\.hk 姚思明 香港大学 香港,中国 smyiu@cs\.hku\.hk ## 1 引言 语言学习者如何知道什么*不该*说?一个听到“*She donated the books to the library*”的孩子必须最终学会“*\*She donated the library the books*”是不可接受的,尽管从未被告知这一点,并且尽管双宾语构式对于语义相似的动词如*give*(Pinker, 1989 (https://arxiv.org/html/2605.23039#bib.bib66);Gropen 等, 1989 (https://arxiv.org/html/2605.23039#bib.bib39))具有完全能产性。这种“从过度概括中撤退”构成了贝克悖论(Baker, 1979 (https://arxiv.org/html/2605.23039#bib.bib76)),这是语言习得中最深层的问题之一。构式语法通过*统计抢先*(statistical preemption)提供了一种有影响力的解决方案:学习者通过跟踪竞争性常规形式的频率来获得负面知识(Goldberg, 2005 (https://arxiv.org/html/2605.23039#bib.bib21), 2018 (https://arxiv.org/html/2605.23039#bib.bib22))。当说话者反复遇到*donate*用于介词与格,而上下文中的双宾语构式在功能上等价时,这种累积的证据就会“抢先”于未获证实的替代形式(Goldberg, 2011 (https://arxiv.org/html/2605.23039#bib.bib23), 2016 (https://arxiv.org/html/2605.23039#bib.bib24))。抢先不同于*固着化*(entrenchment),后者认为频繁听到一个动词用于*任何*构式都会降低将其用于新构式的意愿(Brooks and Tomasello, 1999 (https://arxiv.org/html/2605.23039#bib.bib36);Ambridge, 2020 (https://arxiv.org/html/2605.23039#bib.bib27))。抢先要求接触到一种具有相同交际功能的特定*竞争形式*(Winkler 等, 2015 (https://arxiv.org/html/2605.23039#bib.bib58);Samara 等, 2025 (https://arxiv.org/html/2605.23039#bib.bib59))。 我们提出问题:仅依靠分布统计训练、没有明确语法指导的 LLM,是否捕捉到了统计抢先的分布特征,并与英语使用者观察到的情况平行?这个问题之所以重要,是因为:LLM 提供了一个受控测试,检验分布学习本身是否足以获得负面知识(Misra and Mahowald, 2024 (https://arxiv.org/html/2605.23039#bib.bib52);Yao 等, 2025 (https://arxiv.org/html/2605.23039#bib.bib71);Wonnacott 等, 2008 (https://arxiv.org/html/2605.23039#bib.bib38));每个动词的 LLM 效果可以逐项与人类行为数据进行比较,使用经过验证的链接假设(Hu 等, 2024 (https://arxiv.org/html/2605.23039#bib.bib69));受控训练干预可以提供*因果*证据,表明抢先通过分布竞争发挥作用。 贝克悖论 → 构式语法 → 激发抢先 vs 固着化 竞争形式 → ΔS ∝ 竞争形式频率 整体动词频率 → ΔS ∝ 整体动词频率 相关证据(实验 1–3) → 因果证据(实验 4) ↓ 验证 人类行为基准 图 1:概念框架。贝克悖论激发了构式语法中两种相互竞争的解释,即抢先与固着化,它们对 LLM 的 surprisal 模式做出了不同的预测。我们通过相关证据(实验 1–3)和来自受控训练干预的因果证据(实验 4)进行检验,并利用三个独立来源的人类行为数据进行三角验证。 借鉴近期将 LLM 作为测试语言科学假设工具的工作(McCoy 等, 2024 (https://arxiv.org/html/2605.23039#bib.bib68);Futrell 等, 2019 (https://arxiv.org/html/2605.23039#bib.bib49);Wilcox 等, 2023 (https://arxiv.org/html/2605.23039#bib.bib2);Baroni, 2022 (https://arxiv.org/html/2605.23039#bib.bib51)),我们设计了四个实验:(1) 测试 LLM 的 surprisal 是否区分被抢先与未被抢先的英语形式,并与人类可接受性相关;(2) 使用 Winkler 等人(2015 (https://arxiv.org/html/2605.23039#bib.bib58))的 \+Competing/−\-Competing 设计来区分抢先与固着化,并通过非循环偏相关与人类数据比较;(3) 对 14 个模型拟合一个形式化标度律;(4) 通过使用操纵频率的微调提供收敛的因果证据,并在五个种子下重复,加上反向方向控制。我们建立在该领域使用受控输入训练的因果工作基础上(Misra and Mahowald, 2024 (https://arxiv.org/html/2605.23039#bib.bib52);Misra and Kim, 2024 (https://arxiv.org/html/2605.23039#bib.bib70);Yao 等, 2025 (https://arxiv.org/html/2605.23039#bib.bib71));我们的具体方法论贡献在于:将 LLM 中的抢先–固着化分离与非循环人类数据验证(rpartial=0.58)、跨三个行为数据集的强项目级 LLM–人类相关性(r=0.79)、形式化标度分析、反向方向不对称控制相结合,并在英语与格、使役和处所交替中提供收敛证据。 ## 2 背景 ### 2.1 统计抢先理论 在构式语法(Goldberg, 1995 (https://arxiv.org/html/2605.23039#bib.bib20), 2005 (https://arxiv.org/html/2605.23039#bib.bib21);Bybee, 2010 (https://arxiv.org/html/2605.23039#bib.bib30);Diessel, 2019 (https://arxiv.org/html/2605.23039#bib.bib31))的框架内,Goldberg(2011 (https://arxiv.org/html/2605.23039#bib.bib23))将统计抢先形式化如下:当说话者积累了足够证据表明一个竞争构式在相同交际语境中与动词v常规使用时,动词v被抢先于构式A。形式化地: P(CxB ∣ context for CxA, v) ≫ 0 (1) Goldberg(2018 (https://arxiv.org/html/2605.23039#bib.bib22))将该机制置于更广泛的框架中,平衡了*覆盖*(能产性扩展构式的压力)与*竞争*(既定替代形式的抑制力)。关键预测是*梯度性*:不可接受性会随着竞争证据强度的变化而连续变化(Goldberg, 2016 (https://arxiv.org/html/2605.23039#bib.bib24);Bresnan and Ford, 2010 (https://arxiv.org/html/2605.23039#bib.bib33);Barak and Goldberg, 2017 (https://arxiv.org/html/2605.23039#bib.bib19))。 抢先的行为证据已经有了显著增长。Boyd 等人(2009 (https://arxiv.org/html/2605.23039#bib.bib26))首次展示了 a-形容词产生的机制。Winkler 等人(2015 (https://arxiv.org/html/2605.23039#bib.bib58))提供了关键的分离:对于*有*竞争形式的动词,竞争形式频率预测了不可接受性;对于*没有*竞争形式的动词,这种效应消失。Tachihara 和 Goldberg(2025 (https://arxiv.org/html/2605.23039#bib.bib61))提供了人类方面的第一个*因果*证据。Samara 等人(2025 (https://arxiv.org/html/2605.23039#bib.bib59))使用五项人工语言学习研究,发现所有五项支持抢先,而三项显示固着化效应为零。Wonnacott 等人(2008 (https://arxiv.org/html/2605.23039#bib.bib38))展示了论元结构的分布学习。贝叶斯方法(Perfors 等, 2011 (https://arxiv.org/html/2605.23039#bib.bib37))表明负面知识可以从对正面数据的贝叶斯推理中产生。 抢先–固着化争论一直很细微。Ambridge 等人(2015 (https://arxiv.org/html/2605.23039#bib.bib62))发现了固着化而非抢先的证据,但存在高共线性。Ambridge 等人(2018 (https://arxiv.org/html/2605.23039#bib.bib63))表明两种效应都可靠但很少能分开。Stefanowitsch(2006 (https://arxiv.org/html/2605.23039#bib.bib65))认为来自语料库频率的负面证据限制了过度概括。我们的计算方法提供了一种互补的解决方案:通过使用训练分布完全已知的模型,我们可以直接计算抢先和固着化得分,并评估它们各自的贡献(Perek, 2015 (https://arxiv.org/html/2605.23039#bib.bib29), 2014 (https://arxiv.org/html/2605.23039#bib.bib28);Ellis, 2002 (https://arxiv.org/html/2605.23039#bib.bib32))。 ### 2.2 与格交替作为测试案例 英语与格交替是测试抢先的理想案例,因为它涉及许多动词,分布在交替行为的完整范围上。许多动词可自由交替,但有些受限:*donate*、*explain* 和 *whisper* 抵制双宾语,而 *cost* 和 *fine* 抵制介词与格(Levin, 1993 (https://arxiv.org/html/2605.23039#bib.bib40);Hovav and Levin, 2008 (https://arxiv.org/html/2605.23039#bib.bib41);Gropen 等, 1989 (https://arxiv.org/html/2605.23039#bib.bib39))。Bresnan 等人(2007 (https://arxiv.org/html/2605.23039#bib.bib42))将该交替建模为由大约十个因素(包括有生性、代词性和已知/新信息状态)控制的一种概率选择。Hawkins 等人(2020 (https://arxiv.org/html/2605.23039#bib.bib67))创建了 DAIS 基准,包含 200 个与格动词的 50,000 个强制选择人类判断:这些梯度性的项目级人类数据对于测试抢先至关重要。 ### 2.3 Surprisal 作为链接假设 我们使用词级 surprisal,S(wt) = −log₂ P(wt ∣ w<t) 作为可接受性的代理。Surprisal 已被广泛验证为人类处理难度的关联指标(Hale, 2001 (https://arxiv.org/html/2605.23039#bib.bib43);Levy, 2008 (https://arxiv.org/html/2605.23039#bib.bib44);Smith and Levy, 2013 (https://arxiv.org/html/2605.23039#bib.bib45)),并且也用于测试句法偏好(Futrell 等, 2019 (https://arxiv.org/html/2605.23039#bib.bib49);Wilcox 等, 2023 (https://arxiv.org/html/2605.23039#bib.bib2);Hu 等, 2024 (https://arxiv.org/html/2605.23039#bib.bib69))。我们测量给定动词 v 时,非常规构式(A)相对于常规构式(B)的 surprisal 差异: ΔS(v) = S(构式A ∣ v) − S(构式B ∣ v) (2) 抢先预测:当竞争构式 B 非常频繁时,构式 A 的 surprisal 会更高,从而 ΔS 为正且幅值较大。固着化预测:整体动词频率本身应驱动 ΔS,无论竞争形式如何。我们使用模板句子最小化上下文差异,并取所有动词项目上每个构式中关键位置的 surprisal 平均值。 ## 3 一般方法 ### 3.1 模型 我们测试了 14 个基于 Transformer 的自回归模型:Pythia-160M、Pythia-410M、Pythia-1B、Pythia-2.8B(Biderman 等, 2023 (https://arxiv.org/html/2605.23039#bib.bib53));GPT-2 Small、GPT-2 Medium(Radford 等, 2019 (https://arxiv.org/html/2605.23039#bib.bib54));OLMo-1B、OLMo-7B(Groeneveld 等, 2024 (https://arxiv.org/html/2605.23039#bib.bib55));Gemma-2B、Gemma-7B(Team et al., 2024 (https://arxiv.org/html/2605.23039#bib.bib56));LLaMA-2-7B(Touvron 等, 2023 (https://arxiv.org/html/2605.23039#bib.bib57));以及 Mistral-7B(Jiang 等, 2023 (https://arxiv.org/html/2605.23039#bib.bib58))。该集合在参数规模上变化达两个数量级,涵盖不同的训练语料库和架构变体。 ### 3.2 材料:动词–构式配对 我们基于三个资源构建了 120 个英语动词–构式配对的数据集:与格交替(40 个动词;来自 DAIS 基准,Hawkins 等, 2020 (https://arxiv.org/html/2605.23039#bib.bib67)),使役交替(40 个动词;来自 Levin, 1993 (https://arxiv.org/html/2605.23039#bib.bib40) 和 Goldberget 等, 2004 (https://arxiv.org/html/2605.23039#bib.bib25)),以及处所交替(40 个动词;来自 Brinkmann, 1997 (https://arxiv.org/html/2605.23039#bib.bib35) 和 Ambridge 等, 2008 (https://arxiv.org/html/2605.23039#bib.bib64))。对于每个动词,我们构建了一对最小对比句子,差异仅在非常规构式和常规构式。例如,对于与格: - 常规:She donated the books to the library. - 非常规:She donated the library the books. 句子模板基于 Bresnan 等人(2007 (https://arxiv.org/html/2605.23039#bib.bib42))控制的频率匹配因子,通过重复抽样匹配使动词组的受事和目的地名词的词汇属性和长度。每个动词还通过上下文句子进行控制(见附录 A (https://arxiv.org/html/2605.23039#A1))。 ### 3.3 抢先与固着化的操作化 我们使用语料库频率来操作化抢先和固着化。对于抢先,我们使用 CxG Toolkit(Kunkel 等, 2024 (https://arxiv.org/html/2605.23039#bib.bib60))从基于 12 亿词随机下采样语料库中提取每个动词在一个构式中的竞争形式频率(freq_comp),该语料库包含四个平衡语料库(COCA、BNC、Wikipedia、OpenWebText)。对于固着化,我们记录每个动词的总体频率(freq_total)。对于每个动词,我们计算一个偏好强度指标:pref_score = freq(prep_dative) / (freq(prep_dative) + freq(double_object) + ε),其中 ε = 1 用于拉普拉斯平滑。 ### 3.4 行为验证基准 我们将 LLM 的 surprisal 模式与三个独立收集的人类判断数据集进行比较:(1) DAIS 数据集(Hawkins 等, 2020 (https://arxiv.org/html/2605.23039#bib.bib67)),包含 50,000 个强制选择判断,涵盖 200 个与格动词;(2) Robenalt 和 Goldberg(2015 (https://arxiv.org/html/2605.23039#bib.bib58))的 24 个动词的可接受性评级 (1–7);(3) Tachihara 和 Goldberg(2025 (https://arxiv.org/html/2605.23039#bib.bib61))的 48 个动词的因果证据数据集。所有三个数据集都提供每动词的梯度可接受性,使我们能够直接比较项目级别。 ## 4 实验 1:LLM 中的抢先 ### 4.1 设计 测试 H0:在上下文控制下,预训练 LLM 不会显示非常规构式相对于常规构式的系统性更高 surprisal;H1a:所有模型在非常规且被抢先的构式上会显示更高的 surprisal,且抢先强度应预测 ΔS 幅值。H1b:每个动词的 ΔS 值应与项目级的人类梯度可接受性相关。 ### 4.2 结果:组间差异 所有 14 个模型都显示出预测的梯度模式。表 2 (https://arxiv.org/html/2605.23039#S4.T2) 报告了代表性模型的结果。对于 LLaMA-2 7B,强烈抢先的与格动词产生 ΔS=2.41 比特/词(SD=0.89),弱抢先动词产生 ΔS=1.12(SD=0.72),非抢先动词产生 ΔS=0.33(SD=0.51)。强抢先与无抢先之间的差异高度显著(t(52)=9.87,p<.001,d=2.87)。所有 14 个模型和全部三种构式的完整结果见附录 C (https://arxiv.org/html/2605.23039#A3)。 表 2:按抢先强度分类的与格动词的平均 ΔS(比特/词)。d_S-N = 强 vs. 无的 Cohen d。所有 p<.001(FDR 校正)。 ### 4.3 结果:与人类判断的相关性 每动词的 ΔS 值与 DAIS 基准的人类可接受性强烈相关(表 3 (https://arxiv.org/html/2605.23039#S4.T3))。LLaMA-2 7B 达到 r=0.79 [0.69, 0.86](p<.001,n=80 个动词),所有 1B 参数以上的模型 r 均超过 0.70。与 Robenalt & Goldberg 的相关性为 r=0.74 [0.55, 0.86](24 个动词)。与 Tachihara & Goldberg 的相关性(LLaMA-2 7B 为 r=0.76 [0.64, 0.85])提供了独立复制。三个独立收集的数据集(每个使用不同判断任务)之间的一致性大大增加了 LLM–人类对应反映真正共享敏感性的信心。 表 3:ΔS 与人类可接受性之间的 Pearson 相关性。CI 来自 10,000 次 bootstrap 重采样。所有 p<.001。 ### 4.4 跨构式泛化 抢先模式扩展到与格之外。对于使役动词(LLaMA-2 7B),强烈抢先项目产生 ΔS=2.17,而非抢先项目为 ΔS=0.32(d=2.34)。对于处所动词,效应更加温和(d=1.42),与人类数据中抢先效应较弱一致(Ambridge 等, 2008 (https://arxiv.org/html/2605.23039#bib.bib64))。效应量排序(与格 d=2.87 > 使役 d=2.34 > 处所 d=1.42)在 LLM 和人类中相同(p<.0001,置换检验;保留复制:rtest=0.77;附录 E (https://arxiv.org/html/2605.23039#A5))。 ## 5 实验 2:抢先 vs. 固着化 ### 5.1 设计 关键问题是观察到的效应是否反映真正的抢先,还是仅仅反映固着化——即,动词是因为一个*特定的竞争构式*被常规用作其替代而抵制非常规框架(抢先),还是仅仅因为该动词在任何构式中都被大量使用(固着化)。为了区分两者,我们改编了 Winkler 等人 (https://arxiv.org/html/2605.23039#bib.bib58)(2015 (https://arxiv.org/html/2605.23039#bib.bib58))的 \+Competing/−\-Competing 设计。如果一个动词在我们的语料库注释中识别出一个单一的常规替代构式,该构式占其相关语义角色配置使用的绝大部分(≥60%),并且该替代构式在相同交际语境中与非常规框架功能等价(例如,介词与格中的 *donate*),则该动词被分类为 \+Competing。如果没有任何单一的构式占优势(在任何框架中 ≤45%),或者没有明确的功能等价替代形式(例如,使役用法中的 *swim* 缺乏一个紧密的意译竞争者;其意义通过多样的意译策略表达),则该动词被分类为 −\-Competing。−\-Competing 动词的关键特性是,即使它们整体上频繁(允许固着化适用),它们也缺乏抢先理论所需的单一竞争替代形式。 我们选择了 20 个 \+Competing 和 20 个 −\-Competing 动词,在五个潜在混淆变量上进行了匹配:对数总体频率、Levin 动词类熵、形态复杂性、语域分布、具体性。没有一个匹配变量在组间存在显著差异(所有 p>.20;表 9 (https://...)) (注意:原文在表9处截断,但按规则应继续翻译。由于我们只被要求翻译给定内容,这个截断是原文的一部分。我们保持原样,只翻译到此处。但检查原文,在实验2部分最后有“Table9 (https://”但未完整。可能原文有误。我们按字面翻译,保留未完成链接。实际上原文在Markdown中可能完整,但此处呈现不完整。我们忠实地翻译原文内容。)
相似文章
大型语言模型中的语言生产力:模型能强制,但不会先占
本文探究大型语言模型是否表现出与人类相同的基于使用的语言生产力约束(固化与先占),研究发现模型可以复现强制现象,但无法应用统计先占来避免过度泛化。
“别说!”: 语言模型在禁忌游戏中的约束、合规与沟通
本文评估了语言模型在词汇约束下玩禁忌游戏的表现,展示了合规性与沟通效果之间的权衡,并发现模型作为猜测者比人类弱。
无知识语言模型:抑制参数化回忆以实现基于证据的语言建模
介绍了无知识语言模型(KLLMs),该模型在实体匿名的语料库上进行预训练,以抑制参数化回忆并增强基于证据的推理,在上下文问答、事实验证和幻觉检测基准上取得了显著改进。
大型语言模型能否对检索到的信息保持审慎态度?
本文研究了大型语言模型如何适应检索信息的确定程度,指出了其在处理不确定性方面的系统性局限。论文提出了一种交互策略,在不修改模型权重的前提下,将顺从错误降低了 25%。
语言模型学习什么以及何时学习?隐性课程假设
本文提出隐性课程假设,证明语言模型预训练遵循一个结构化的、组合性的课程,其中能力跨架构一致涌现,并可从内部表示预测。作者通过设计涵盖检索、形态学、共指消解、推理和数学的任务进行验证,发现四个模型族中涌现顺序高度一致(ρ=0.81)。