适应是双向的:研究人类与语言模型之间的语言趋同

arXiv cs.CL 论文

摘要

本文研究了在多轮对话中人类与大型语言模型之间的语言适应性,发现LLM过度趋同于用户风格,而人类适应LLM的方式与适应其他人类并无不同。

arXiv:2605.29278v1 公告类型:新 摘要:随着LLM日益融入日常生活,理解它们的存在将如何塑造人类语言行为仍是一个开放性问题。我们提出了一项关于人类与LLM对话中语言趋同的大规模研究,考察了在多轮对话中人类和LLM如何适应彼此的语体风格。使用一种非对称趋同度量方法,基于WildChat(一个由真实世界ChatGPT对话记录组成的语料库),我们发现:尽管LLM在八种语言的功能词和开放类特征上都显著过度趋同于其用户,但人类在此场景下的趋同率与人类-人类基线基本一致。这些发现表明,人类与LLM对话中的适应性是非对称的:LLM过度拟合用户风格,而人类在语言上适应LLM的方式与适应另一个人并无不同。
查看原文
查看缓存全文

缓存时间: 2026/05/29 09:17

# 适应是双向的:研究人类与语言模型之间的语言趋同
来源:https://arxiv.org/html/2605.29278
Terra Blevins Khoury College of Computer Sciences Northeastern University, Boston, MA t\.blevins@northeastern\.edu

###### 摘要

随着大型语言模型(LLMs)日益融入日常生活,理解它们的存在将如何塑造人类语言行为仍是一个开放性问题。我们开展了一项关于人机对话中语言趋同的大规模研究,考察人类和LLMs在多轮对话中如何相互适应对方的语言风格。使用WildChat(一个真实世界的ChatGPT对话语料库)上的非对称趋同度量,我们发现,虽然LLMs在八个语言的功能词和开放类特征上都显著过度趋同于其用户,但人类在此环境下的趋同率与人类-人类基线大体一致。这些发现表明,人类-LLM对话中的适应是不对称的:LLMs过度拟合用户的风格,而人类在语言上适应LLMs的方式与适应另一个人并无不同。

适应是双向的:研究人类与语言模型之间的语言趋同

Terra Blevins
Khoury College of Computer Sciences
Northeastern University, Boston, MA
t\.blevins@northeastern\.edu

## 1 引言

大型语言模型(LLMs)能够生成与人类语言难以区分的对话文本,从而通过图灵测试(Jones and Bergen,2025 (https://arxiv.org/html/2605.29278#bib.bib18))。随着这些模型越来越多地部署在专业和个人场景中,LLMs成为自然语言环境中的新语言参与者,用户可以与它们(几乎)像与另一个人一样自然地互动。然而,尽管它们的存在日益增长,人们对于与LLMs互动如何塑造人类对话者的语言行为知之甚少。

我们通过**语言适应**的视角来探讨这个问题,即说话者在对话过程中根据对话者的语言调整自身语言的倾向。这种语言适应在很大程度上是无意识的,并体现在从音系学和句法到词汇选择等各种语言特征上(Giles et al.,1991 (https://arxiv.org/html/2605.29278#bib.bib15)),并且观察到人类会表现出一些适应行为以便与对话系统进行交流(Brennan,1996 (https://arxiv.org/html/2605.29278#bib.bib9))。在本研究中,我们基于先前用于研究对话系统中适应的计算方法(Ireland et al.,2011 (https://arxiv.org/html/2605.29278#bib.bib17); Danescu-Niculescu-Mizil and Lee,2011 (https://arxiv.org/html/2605.29278#bib.bib13)),分析人类和模型的语言在人类-LLM交互过程中是否**趋同**。

我们使用这个框架来提出以下问题:

**R1:** LLMs在多轮对话过程中是否会趋同于用户的风格?

**R2:** 人类用户是否会趋同于其LLM对话者的风格?

**R3:** 人类对LLMs的适应是否与对人类对话者的适应不同?

**R1** 在先前的工作中已得到部分解决:Kandra et al. (2025 (https://arxiv.org/html/2605.29278#bib.bib20)) 测试了两个LLMs是否会随时间在句法上趋同,而Blevins et al. (2026 (https://arxiv.org/html/2605.29278#bib.bib6))评估了LLMs在要求替换现有对话中的轮次时是否会根据上下文进行风格适应。然而,这些设置都是分别使用模型-模型交互和轮次替换提示的合成评估;尚无研究在真实聊天机器人环境中跨多种语言检查人类和LLMs的逐轮协调。此外,这些交互中的人类方面仍未得到充分探索,关于用户在与LLMs对话时是否会以及如何调整其语言,仍存在开放性问题。

我们使用WildChat(Zhao et al.,2024 (https://arxiv.org/html/2605.29278#bib.bib33))来研究这些问题,这是一个来源于可选参与的ChatGPT交互记录的人类-LLM对话语料库,用以比较LLMs和人类在八种语言中关于多种词汇趋同的适应行为,并将此环境中的人类行为与人类-人类对话中观察到的行为进行对比。我们的分析表明,LLMs对用户的适应程度显著高于人类对LLMs的适应,这与先前的合成评估结果一致(Blevins et al.,2026 (https://arxiv.org/html/2605.29278#bib.bib6))。令人惊讶的是,我们还发现,虽然在WildChat对话中用户适应的程度低于LLMs,但人类在人类-LLM交互中的适应率与人类-人类对话基本一致。这种不对称性对所有考察的特征和语言都成立,表明在此环境中人类和LLMs的适应在语言和跨语言上都是稳健的。这些发现表明,人类在语言上适应现代LLMs的方式与适应另一个人并无不同,尽管LLM表现出不对称且过度适应的行为。

## 2 相关工作

适应是一种有充分记录的现象,即说话者根据对话者调整自己的语言,体现在从音系学到词汇选择的各种特征上(Giles et al.,1991 (https://arxiv.org/html/2605.29278#bib.bib15); Brennan and Clark,1996 (https://arxiv.org/html/2605.29278#bib.bib10))。我们关注的是语言趋同,即说话者的风格随时间推移变得更像其对话者的风格(Niederhoffer and Pennebaker,2002 (https://arxiv.org/html/2605.29278#bib.bib27))。Ireland et al. (2011 (https://arxiv.org/html/2605.29278#bib.bib17)) 和 Danescu-Niculescu-Mizil and Lee (2011 (https://arxiv.org/html/2605.29278#bib.bib13)) 开发了用于测量大规模语料库中趋同的计算方法,使得大规模研究适应成为可能,而 Ward and Litman (2007 (https://arxiv.org/html/2605.29278#bib.bib31)) 将其扩展到词汇同化,表明对内容词的适应可以自动测量。这些方法已广泛应用于人类-人类对话环境(Mukherjee and Liu,2012 (https://arxiv.org/html/2605.29278#bib.bib24); Bawa et al.,2018 (https://arxiv.org/html/2605.29278#bib.bib3); Berdičevskis and Erbro,2023 (https://arxiv.org/html/2605.29278#bib.bib4), 等等)。

最近,这些方法被用于研究LLM的适应,尽管是在人工环境中。Kandra et al. (2025 (https://arxiv.org/html/2605.29278#bib.bib20)) 发现LLMs在模型到模型的交互中句法上趋同,而Blevins et al. (2026 (https://arxiv.org/html/2605.29278#bib.bib6)) 显示LLMs在完成现有人类对话中的轮次时会适应上下文。我们通过研究预先存在的人类-LLM交互中的适应来扩展这些发现,从而能够直接比较此环境中LLM和人类的适应。与我们的工作同时,Chen et al. (2026 (https://arxiv.org/html/2605.29278#bib.bib11)) 将双向的内部-外部设计应用于英语GPT-4o对话,并发现了类似的LLM-用户不对称性。我们证实了这些先前的发现,并表明LLMs在这种部署的真实环境中也会过度趋同。

另一条关于计算机作为社会行为者的平行工作表明,人们会无意识地将社会规则应用于计算机(Nass et al.,1994 (https://arxiv.org/html/2605.29278#bib.bib26); Nass and Moon,2000 (https://arxiv.org/html/2605.29278#bib.bib25))。然而,关于用户适应计算机的证据是混合的:Brennan (1996 (https://arxiv.org/html/2605.29278#bib.bib9)) 发现用户会同化计算机生成的指称表达,但最近关于人类-模型交互的工作表明,用户在与LLMs互动时采用了不同的语言行为(Bhatt and Rios,2021 (https://arxiv.org/html/2605.29278#bib.bib5); Zhang and Yu,2025 (https://arxiv.org/html/2605.29278#bib.bib32))。我们直接解决这个问题,发现人类适应在LLM-和人类-人类环境中大致稳定。

## 3 方法与实验设置

为了研究人类和LLMs如何相互适应,我们分析了来自多种语言真实世界语料库的对话。

表1:所有实验设置的数据集统计。WildChat代表人类-LLM对话,而DailyDialog和Ubuntu覆盖人类-人类对话。
表2:在平均NOUN和LIWC得分以及LIWC中每个功能词类别上的WildChat(EN)、DailyDialog和Ubuntu的趋同分数。除非有下划线,所有值在p<0.05水平上显著。Δ= WildChat LLM - 用户。DailyDialog得分是两位说话者的平均值。

### 3.1 数据

我们的主要分析基于Wildchat(Zhao et al.,2024 (https://arxiv.org/html/2605.29278#bib.bib33)),这是一个包含约一百万条人类用户与ChatGPT(GPT-3.5-Turbo和GPT-4)之间真实世界对话的语料库,涵盖众多主题和语言,非常适合研究有机的人类-LLM交互。在我们的研究中,我们将这些对话筛选为包含2到10个(人类,LLM)轮次对的对话。然后,我们在8种语言(英语、法语、西班牙语、葡萄牙语、意大利语、俄语、中文和土耳其语)中每种语言抽取最多5000个对话,使用按轮次数分层抽样,以确保样本中有各种长度的对话。包含的语言必须频繁出现(过滤后约2500个或更多对话),并且具有计算趋同特征所需的语言特定资源。

作为对LLM-人类对话研究的对比,我们也考虑了人类-人类对话环境中的说话者行为。鉴于聊天机器人对话固有的配对结构,我们专注于二元设置,即两位说话者之间的对话,并考虑两个符合此标准的英语数据集:DailyDialog(Li et al.,2017 (https://arxiv.org/html/2605.29278#bib.bib21)),一个广泛使用的日常对话对话数据集,以及Ubuntu对话语料库(Lowe et al.,2015 (https://arxiv.org/html/2605.29278#bib.bib22))中的原始对话,一个来自Ubuntu IRC频道的技术支持对话语料库,提供了一个代表常见LLM用例的面向任务的人类-人类基线。111由于它们的发布时间,两个语料库中包含机器生成内容的风险很小。我们对人类-人类基线采用与WildChat相同的预处理步骤,要求两位说话者之间的所有轮次都是配对的。表1提供了过滤后的数据统计。

### 3.2 趋同度量

与先前关于LLM适应的工作(例如,Blevins et al., 2026)不同,我们研究的是交互式聊天机器人设置中人类和LLM的独立行为,因此需要一个非对称度量来分离对话伙伴对彼此的影响。我们采用Danescu-Niculescu-Mizil and Lee (2011)的趋同度量,该度量衡量一位说话者在二元特征t上适应另一位说话者的程度。对于A发起而B回应的交流,让a^t和b→a^t分别为A的话语和B的回复中表现出特征t的指示变量。那么B对A的协调定义为Conv(B→A, t):

P(b→a^t=1 | a^t=1) - P(b→a^t=1)   (1)

正分数表示当A使用t时,B使用t的频率高于其基线率(趋同);负分数表示偏离。除非另有说明,Conv是样本中所有轮次的平均值。

我们测量两种特征类型的趋同:

**LIWC功能词**是频繁且大多无意识的标记,对人类对话中的适应效应敏感(Niederhoffer and Pennebaker,2002)。遵循Danescu-Niculescu-Mizil and Lee (2011)和Ireland et al. (2011),我们测量来自语言查询与词计数(LIWC)词典的功能词类别上的趋同(Chung and Pennebaker,2012)。我们使用语言特定的LIWC 2007词典(附录A)用于研究中的语言,报告每类得分和平均得分。222由于语法和词典版本的差异,功能词覆盖率因语言略有不同——例如,中文和土耳其语中缺少冠词。

**NOUN词元**反映词汇同化(Brennan and Clark,1996),即说话者在讨论一个概念时倾向于采用对方的具体词汇选择。遵循Ward and Litman (2007),我们每个语料库提取最频繁的100个名词词元,并在可能的情况下过滤到至少有一个WordNet同义词(Fellbaum,1998)的名词,以确保每个词元代表一个词汇选择。333WordNet过滤适用于EN、FR、ES、PT、IT和ZH,通过NLTK OMW 1.4(Bond and Foster, 2013);RU和TR由于覆盖缺失仅使用频率过滤。我们报告所选名词的词汇表中平均趋同得分;附录表5报告了每个设置中选择哪些词元。

## 4 结果

表2报告了我们在英语WildChat以及两个人类-人类基线上的实验结果。总体而言,人类和LLMs都表现出显著高于随机机会的趋同。此外,我们观察到:

#### 人类说话者对LLMs和人类的适应相似

我们在WildChat用户、DailyDialog说话者以及两个Ubuntu设置(由于寻求帮助的用户和协助用户的专家的角色不同而分开)的人类说话者设置中看到大致一致的趋同得分:在所有三个设置中,人类说话者的平均LIWC趋同得分范围在0.022–0.036之间,名词趋同得分在0.104–0.141之间。这表明,不仅说话者在不同对话设置和角色中大致一致,而且他们对LLM对话者的行为在考虑的度量上也是相似的。一个例外是,在否定词上,人类说话者适应LLMs更多:WildChat用户显示出显著的更高否定趋同(0.081),而DailyDialog(-0.005)或Ubuntu(0.012)的非显著得分,这可能是由LLMs在同一词类上(大得多的)趋同(0.213)驱动的。

#### LLMs过度趋同于用户

我们发现LLMs显著过度趋同于用户,无论是相对于与他们对话的用户,还是相对于我们两个基线语料库中的人类-人类适应率。这与先前的工作(Blevins et al.,2026)一致,并进一步表明,即使在真实的部署环境中,LLM对用户风格的镜像相对于人类行为也是过度的。具体来说,LLMs在LIWC上的平均趋同大约是用户率的两倍(0.068对0.035),LLM得分相对于用户在个别特征上的相对增加范围从介词上的22%到否定功能词上的164%(一个异常值,与两个人类-人类基线中看到的极小的否定趋同形成鲜明对比)。LLMs在名词上的趋同甚至

相似文章

大型语言模型有多像人类?一个关注语域的语言评估框架

arXiv cs.CL

本文提出了一种关注语域的语言评估框架,通过使用最大均值差异(MMD)比较人类与LLM生成文本中67个词汇语法特征的分布,来评估大型语言模型(LLM)的人类相似度。在七个经过指令微调的开源模型和五个语域上的实验表明,没有模型能完美匹配人类基线,且与人类语言的接近程度因语域而异,而非模型规模。