超越“AI语言”:论LLM输出的个人言语特征本质
摘要
本文认为,大语言模型的输出展现出类似人类个人言语的模型特定语言特征,通过分析2024年和2026年的语料库,揭示了代际变化以及稳定的个体模型画像。
arXiv:2608.06589v1 公告类型:新
摘要:虽然大语言模型的输出常被作为一个集体超级变体来分析,称为“AI语言”,但本章认为,这种视角与类似于人类个人言语的、独特的模型特定语言特征并存。我们分析了两个关于社会议题的LLM生成文本数据集:一个包含六个模型的2024年语料库(Improta et al. 2024),以及一个新生成的2026年语料库,该语料库使用相同的提示词,包含六个当代模型。我们的研究利用计算描述符和文体学主成分分析,揭示了2024年和2026年群体风格之间的代际转变,同时表明每个单独模型都保持独特的语言特征。这种多层次相互作用通过缩略词频率得以体现,在同一模型群体(2026年)中,缩略词频率从每百万词超过1200次到超过30000次不等。最终,我们得出结论,将LLM输出视为本质上具有个人言语特征,为变异与变化研究、LLM生成文本检测、法医语言学和基于用法的语言研究方法提供了有价值的框架。
查看缓存全文
缓存时间: 2026/08/10 08:02
# 超越“AI语言”:论LLM输出的个人方言性质 来源:https://arxiv.org/abs/2608.06589 查看 PDF (https://arxiv.org/pdf/2608.06589) > 摘要:尽管大语言模型的输出常被作为一种被称作“AI语言”的集体超级语言变体来分析,但本章认为,这一视角与类似于人类个人方言的、模型特有的独特语言特征并存。我们分析了两个关于社会议题的LLM生成文本数据集:一个是2024年的语料库(包含六个模型;Improta et al. 2024),另一个是使用相同提示词、涵盖六个当代模型的新生成的2026年语料库。我们利用计算描述符和文体计量主成分分析发现,2024年和2026年两组模型之间的文体存在代际转变,同时表明每个单独模型都保持独特的语言特征。这种多层交互通过缩约形式频率得以体现:在2026年同一批模型中,缩约形式频率从每百万词超过1,200次到超过30,000次不等。最后,我们得出结论:将LLM输出视为具有个人方言性质,为变异与变化研究、LLM生成文本检测、司法语言学以及基于使用的语言研究方法提供了一个具有潜在意义的框架。 ## 提交历史 来自:Thomas Stephan Juzek [查看邮箱 (https://arxiv.org/show-email/309f2afd/2608.06589)] **\[v1\]** 2026年8月6日星期四 21:03:13 UTC(1,061 KB)
相似文章
为什么即使所有变量保持不变,LLM仍会生成不同的输出?
本文探讨了为什么即使所有变量恒定,大型语言模型对相同提示仍生成不同输出,并将其归因于AI采样过程中固有的随机性。
Linguistic Monoculture in LLM-Assisted Language Use
This paper introduces a mathematical framework to study how reliance on shared LLMs for writing may reduce population-level linguistic diversity, analyzing fixed, recursive, and personalized interaction mechanisms and characterizing equilibria and convergence rates.
LLMs时代:语言多样性的日渐式微
本研究论文探讨了大型语言模型如何导致语言多样性下降,并强调了潜在的文化和社会风险。
大型语言模型有多像人类?一个关注语域的语言评估框架
本文提出了一种关注语域的语言评估框架,通过使用最大均值差异(MMD)比较人类与LLM生成文本中67个词汇语法特征的分布,来评估大型语言模型(LLM)的人类相似度。在七个经过指令微调的开源模型和五个语域上的实验表明,没有模型能完美匹配人类基线,且与人类语言的接近程度因语域而异,而非模型规模。
为了内容而内容
作者探讨了LLM如何影响编码和日常语言中的用词,发现LLM偏好的词汇在编程会话和Google Trends中出现的频率均有所增加,这引发了人们对人类开始采用LLM写作风格的担忧。