指令微调模型在局部重用人句法方面超过人类

arXiv cs.CL 论文

摘要

本文研究了指令微调大型语言模型中的句法趋同现象,发现它们在对话上下文中重用人句法的频率超过人类自身,并且指令微调增加了对句法模式的依赖。

arXiv:2607.26015v1 公告类型:新 摘要:句法趋同(说话者在语言上适应其对话者语法特征的趋势)是人类对话中一个被充分记录的特征,被广泛认为在意识水平以下运行。大型语言模型是否相对于人类基线并在广泛的句法结构上表现出类似的对人类用户的句法趋同,仍然是一个未解的问题。使用替代范式数据(即模型生成替换预先存在的人类对话中一个说话者的语轮),本研究测量了16个开放权重的Llama和Gemma模型(1B-70B,预训练和指令微调)在每模型1901个匹配位置上相邻语轮之间上下文无关文法(CFG)规则的重复使用。每个模型与前一个人语轮的CFG规则重叠程度都高于与一个采样的无关人类引子的重叠,并且在每个模型中,这种实际与随机的差异对于低频规则更大。每个指令微调模型还表现出与真实引子的自然输出重叠高于它替换的人类回应,并且所有八组匹配的架构对在指令微调后都表现出更大的真实引子重叠。然而,相对于预训练变体,指令微调输出与无关引子的重叠更多,实际与随机增量的差异更小,并且在目标规则集大小保持不变时,条件规则重复使用的几率更低。在探索性分析中,每个模型与前一个语轮的平均词汇和语义相似度都高于匹配的人类回应。此外,在所有八组架构对中,指令微调模型产生的回应在平均语义相似度上高于其预训练对应模型,而词汇相似度的结果则更加异质。
查看原文
查看缓存全文

缓存时间: 2026/07/29 09:56

# 指令调优模型在局部范围内比人类更频繁地复用人类句法
来源:https://arxiv.org/html/2607.26015
###### 摘要

句法趋同——说话者在语言中适应对方语法特征的趋势——是人类对话中充分记录的特征,被广泛认为在意识层面之下运作。大型语言模型是否表现出相对于人类基线(且跨广泛句法结构)向人类用户类似的句法趋同,仍是一个未解之谜。本研究使用 Blevins 等人 [2026] 的替换范式数据,其中模型生成替换了已有人类对话中一名说话者的话语轮次,在每模型 1,901 个匹配位置上,测量了十六个开放权重 Llama 和 Gemma 模型(1B–70B,预训练和指令调优)中对话轮次相邻的上下文无关文法(CFG)规则的复用情况。每个模型都表现出与前一个人话语轮次比与一个采样的无关人类启动词更大的 CFG 规则重叠,并且在每个模型中,对于较低频率的规则,这种实际与随机之间的差异更大。每个指令调优模型还显示出比其所替代的人类回应更大的与实际启动词的自然输出重叠,并且所有八个匹配的架构对在指令调优后都表现出更大的实际启动词重叠。然而,相对于预训练变体,指令调优的输出与无关启动词重叠更多,实际与随机增量更小,并且在目标规则集大小保持恒定时条件规则复用几率更低。在探索性分析中,每个模型都表现出比匹配的人类回应更大的与前一个话语轮次的平均词汇和语义相似度。指令调优模型在所有八个架构对中还产生了平均语义相似度高于其预训练对应物的回应,而词汇相似度结果则更具异质性。

## 1 引言

当说话者模仿对方的语法结构时,她参与了一个称为句法趋同的过程。例如,在听到“我给了你那本书”后,她可能更倾向于回应“你给你母亲寄了那封信”(复用双宾语构式),而不是同样符合语法的“你把那封信寄给了你母亲”(Bock,1986 (https://arxiv.org/html/2607.26015#bib.bib1); Braniganet al.,2000 (https://arxiv.org/html/2607.26015#bib.bib6))。句法趋同被广泛认为相对不受意识觉察影响,通常通过结构启动机制来解释(Bock,1986 (https://arxiv.org/html/2607.26015#bib.bib1); Pickering and Garrod,2004 (https://arxiv.org/html/2607.26015#bib.bib13))。

作为能够生成句法连贯文本的实体,大型语言模型(LLM)如今在人口规模上已成为常规对话者。对称的 LLM 句法对齐(Kandrae t al.,2025 (https://arxiv.org/html/2607.26015#bib.bib17); Mayoret al.,2025 (https://arxiv.org/html/2607.26015#bib.bib8); Chenet al.,2026 (https://arxiv.org/html/2607.26015#bib.bib19))和结构启动(Sinclairet al.,2022 (https://arxiv.org/html/2607.26015#bib.bib31); Michaelovet al.,2023 (https://arxiv.org/html/2607.26015#bib.bib9); Jumeletet al.,2024 (https://arxiv.org/html/2607.26015#bib.bib18); Caiet al.,2024 (https://arxiv.org/html/2607.26015#bib.bib30))此前已有研究,LLM 的风格计量适应(Blevinset al.,2026 (https://arxiv.org/html/2607.26015#bib.bib15))(包括对人类的方向(Blevins,2026 (https://arxiv.org/html/2607.26015#bib.bib16)))也是如此。然而,LLM 是否以及如何在句法上方向性地向人类趋同——相对于匹配的人类回应且跨多种句法结构——至今仍未有答案。

通过分析 Blevins 等人 (2026 (https://arxiv.org/html/2607.26015#bib.bib15)) 替换范式中的数据,我使用一个针对人机对话中方向性局部句法趋同的测量管道,并将其应用于来自十六个开放权重模型(涵盖两个系列,参数规模从 1B 到 70B,且包含预训练与指令调优版本)的双人对话。具体来说,我测量了 LLM 生成的话语轮次是否复用了它们所回应的人类话语轮次的上下文无关文法(CFG)规则,既相对于无关启动词基线,也相对于被 LLM 输出替换的原始人类回应。

这一比较得出了四个主要结果。第一,所有十六个模型都以高于无关启动词基线的程度复用实际启动词 CFG 规则(RQ1)。第二,每个指令调优模型都显示出比匹配的人类回应更强的自然输出句法对齐(尽管对无关启动词重叠和结构机会的分解对简单的“指令调优下复制更强”的解读提出了审慎的修正)(RQ2)。第三,规则频率似乎在人类、预训练模型和指令调优模型之间以不同方式塑造实际启动词复用(RQ3)。最后,十六个模型中的每一个都表现出比匹配的人类回应更大的与前一个话语轮次的平均词汇和语义相似度(RQ4)。

有必要精确说明本文所用的术语。我用*趋同*(同时存在长期和短期实例——启动是后者的一个例子)专门指代向另一个对话者的适应,用*对齐*来描述由此产生的状态或相似度程度。重要的是,与实际启动词的更大规则重叠可能源于回应更强烈地复用句法,也可能源于回应包含更多结构材料从而提供更多重叠机会,或两者兼有。我用*总自然输出对齐*表示实际生成回应中与实际启动词的重叠量,*实际与随机增量*表示由真实对话启动词相对于无关启动词所产生的额外重叠,*条件复用倾向*表示在控制目标规则集大小后的分析。

## 2 背景

虽然交流中的镜像行为广泛出现在多种行为中(包括语言和副语言层面),但句法趋同在理论上是一个独特的趋同维度。语法形式可以独立于词汇内容而重复出现(Bock,1986 (https://arxiv.org/html/2607.26015#bib.bib1); Braniganet al.,2000 (https://arxiv.org/html/2607.26015#bib.bib6))。历史上,测量结构*启动*的主要实验范式涉及操控预指定的构式,并以二分类方式编码参与者是否随后产生了相同形式(Bock,1986 (https://arxiv.org/html/2607.26015#bib.bib1); Braniganet al.,2000 (https://arxiv.org/html/2607.26015#bib.bib6))。基于上下文无关文法(CFG)的语料库方法则将话语表示为从成分分析树中提取的产生式规则,从而可以在不预设分析构式的情况下进行广泛覆盖的测量(Reitter and Moore,2014 (https://arxiv.org/html/2607.26015#bib.bib14))。

为了测量 LLM 的语言适应,Blevins 等人 (2026 (https://arxiv.org/html/2607.26015#bib.bib15)) 引入了一种替换范式,该范式用 LLM 生成替换已有人类对话中一名说话者的话语轮次,从而可以直接比较 LLM 生成的回应与人类说话者在相同对话位置上实际所说的内容。他们的风格计量分析(包括令牌新颖性和话语长度)显示,模型和人类的趋同特征在不同特征和调优模式下各不相同。相比之下,Kandra 等人 (2025 (https://arxiv.org/html/2607.26015#bib.bib17)) 研究句法结构,将其分析限制在*LLM 内部*对话中,并使用对称的聚合测量。其他实验提供了语言模型中人类类结构启动特征的补充证据,包括逆频率效应(Jumeletet al.,2024 (https://arxiv.org/html/2607.26015#bib.bib18)),但未将生成的对话回应与匹配的人类受访者在一系列句法结构上进行对比。理解 LLM 的(句法)适应变得越来越紧迫,因为 Augustin 等人 (2026 (https://arxiv.org/html/2607.26015#bib.bib32)) 提出了一个“放大螺旋”,其中语言对齐、超个性化生成和谄媚可能在构建用户妄想信念中共存。

因此,本研究提出四个问题:

1. RQ1:LLM 是否复用紧邻的前一个人话语轮次的 CFG 规则,且高于无关启动词基线?
2. RQ2:LLM 比匹配的人类受访者在同一话语轮次位置上复用 CFG 规则更多还是更少?
3. RQ3:规则频率对人类、预训练和指令调优回应中复用的影响方式是否相同?
4. RQ4:人类与模型在相似度方面的差异是否也出现在词汇和语义层面,而不仅是句法层面?

## 3 方法

### 3.1 数据与替换范式

人类话语轮次来自 DailyDialog(Liet al.,2017 (https://arxiv.org/html/2607.26015#bib.bib20)),这是一个双语英语对话数据集,同时使用 Blevins 等人 (2026 (https://arxiv.org/html/2607.26015#bib.bib15)) 发布的替换版本,其中 LLM 生成的补全从第六轮次开始替换一个说话者的所有话语。根据他们的预处理,对话被限制为至少包含六个轮次的双人对话,共得到 707 个对话;他们的模型生成和预处理代码都公开发布。对每个模型都分析了全部 707 个对话。

评估了十六个开放权重语言模型:Llama-3.1 (8B, 70B) 和 Llama-3.2 (1B, 3B) 系列(Grattafioriet al.,2024 (https://arxiv.org/html/2607.26015#bib.bib2)),以及 Gemma-3 系列 (1B, 4B, 12B, 27B)(Gemma Teamet al.,2025 (https://arxiv.org/html/2607.26015#bib.bib3)),每个系列都包含预训练和指令调优变体。由于每个模型完成完全相同的对话,且人类话语轮次在所有版本中保持固定,因此回应可以直接跨模型以及针对相同对话上下文中的原始人类回应进行比较。生成的回应被限制为最多 40 个新令牌。从第二个被替换位置开始,模型的生成部分地基于其自身之前的生成;然而,在分析的启动词-目标对中,紧邻的前一个话语轮次始终是人类的话语。

最终,每个模型有 1,918 个被替换的位置。其中 17 个位置的紧邻人类启动词中没有合格规则,被排除,留下每个模型精确匹配的 1,901 个位置。没有用其他非邻近启动词替换缺失的启动词。没有合格规则的人类或模型目标被保留下来,并对每个合格启动词规则贡献零结果。

### 3.2 句法标注与规则合格性

所有话语,包括人类和 LLM 生成的,都使用 benepar 的 benepar_en3_large 成分分析器进行解析(Kitaev and Klein,2018 (https://arxiv.org/html/2607.26015#bib.bib21); Kitaevet al.,2019 (https://arxiv.org/html/2607.26015#bib.bib22)),并使用 spaCy(Montaniet al.,2023 (https://arxiv.org/html/2607.26015#bib.bib5))进行分词和切分。在解析前,话语文本通过将空白序列压缩为单一空格进行归一化。

成分分析将话语表示为一棵树,其非终端节点编码诸如 S、NP 和 VP 等句法类别。例如,对“The reader reviewed the paper”的分析包含产生式

\mathrm{S}\rightarrow\mathrm{NP}\ \mathrm{VP},\qquad\mathrm{NP}\rightarrow\mathrm{DT}\ \mathrm{NN},\qquad\mathrm{VP}\rightarrow\mathrm{VBD}\ \mathrm{NP}.
CFG 产生式记录了一个非终端节点如何扩展为其直接子节点。词性前置终端节点直接扩展到终端词,如 DT\(\rightarrow\)The。对于话语 \(u\),令 \(\rho(u)\) 表示从其句子级分析树中提取的 CFG 产生式的多重集。\(R(u)\) 是 \(\rho(u)\) 中出现的不同合格规则类型的集合,其中规则合格的条件是非单元的,且在原始人类语料中出现超过一次。因此,同一规则在一个话语内的重复出现只贡献一次。频率仅从人类话语轮次计算一次,防止模型输出改变规则合格性或频率尺度。(词汇前置终端的产生式是单元的,因此已被排除。)人类语料共有 10,887 个规则类型,其中 1,405 个满足全局合格标准;在分析用的启动词集中出现了 1,138 个。

### 3.3 匹配的实际、人类和无关启动词条件

对于匹配的位置 \(i\),写出 \(p_i\) 表示启动词(在 \(t-1\) 处的上一人类话语轮次),\(h_i\) 表示在 \(t\) 处的原始人类回应,\(m_i\) 表示在 \(t\) 处的模型生成,而 \(\tilde{p}_i\) 表示从不同对话中使用固定种子抽样的人类启动词。每个位置抽取一个 \(\tilde{p}_i\),并在所有十六个模型之间共享(以确保模型比较不会继承不同的随机基线)。三个条件对在**人类**条件下配对 \((p_i, h_i)\),在**实际**模型条件下配对 \((p_i, m_i)\),在**随机**条件下配对 \((\tilde{p}_i, m_i)\)。因此,人类和模型目标对相同的潜在句法启动源做出回应,而无关启动词条件保持模型回应固定,仅改变启动词。

对于位置 \(i\) 的每个条件 \(\kappa\) 和每个合格的启动词规则 \(r_j\),二分类结果定义为

\[
y_{ij}^{\kappa}=\mathbf{1}\!\left[r_j \in R(\mathrm{target}_{i}^{\kappa})\right].
\]
规则频率表示为均值中心化的 \(\log F_H(r_j)\),启动词结构大小表示为均值中心化的 \(\log|R(\mathrm{prime}_i)|\)。在对数前不需要加法常数:合格规则满足 \(F_H(r)>1\),且启动词规则集为空的位置在分析前被排除。在结构机会分析中,目标大小表示为均值中心化的 \(\log(|R(\mathrm{target}_i)|+1)\)。(\(+1\) 偏移仅对目标大小是必要的,因为有效的人类或模型回应可能不包含合格规则。)这一过程每模型产生 39,222 个规则级观测值,或跨十六个每模型数据集共 627,552 个观测值。

### 3.4 统计模型

对于每个模型,在条件 \(\kappa \in \{\textsc{human},\textsc{actual},\textsc{random}\}\) 上拟合一个逻辑混合效应模型。令 \(\tilde{x}_j = \widetilde{\log F_H(r_j)}\) 表示合格启动词规则 \(r_j\) 的均值中心化对数频率,令 \(\tilde{q}_i^{\kappa} = \widetilde{\log|R(\mathrm{prime}_i^{\kappa})|}\) 表示相关启动词规则集的均值中心化对数大小。其中,在**人类**和**实际**条件下,\(p_i^{\kappa}=p_i\),而在**随机**条件下,\(p_i^{\kappa}=\tilde{p}_i\)。

使用 **人类** 作为参考条件,线性预测器为

\[
\operatorname{logit}\Pr\!\left(y_{ij}^{\kappa}=1\right)=
\beta_0 + \beta_{\mathrm{A}}\, \mathbf{1}\!\left\{\kappa=\textsc{actual}\right\} + \beta_{\mathrm{R}}\, \mathbf{1}\!\left\{\kappa=\textsc{random}\right\}
\]

相似文章

利用自监督指南提升视觉指令调优

Hugging Face Daily Papers

本文提出通过将自监督任务表达为自然语言指令,增强多模态语言模型中的视觉指令调优,从而在不增加架构或标注的情况下提升以视觉为中心的推理能力。通过将经典的自监督预文本任务(如旋转预测、颜色匹配和跨视角对应)重构为图像-指令-响应对,该方法仅需在训练数据中注入3%-10%的视觉化指令,便能在多个基准测试中实现一致的性能提升。

基础模型在AI检测器中像人类

Hugging Face Daily Papers

一项研究发现,基础语言模型在AI检测器中看起来像是人类写的,而经过指令微调的模型则不然。作者提出了一种名为HIP的改写管道,该管道能在不同模型规模下提高文本的人类相似度,同时保持语义。