超越“AI语言”:论LLM输出的个人言语特征本质
摘要
本文认为,大语言模型的输出展现出类似人类个人言语的模型特定语言特征,通过分析2024年和2026年的语料库,揭示了代际变化以及稳定的个体模型画像。
查看缓存全文
缓存时间: 2026/08/10 08:02
# 超越“AI语言”:论LLM输出的个人方言性质 来源:https://arxiv.org/abs/2608.06589 查看 PDF (https://arxiv.org/pdf/2608.06589) > 摘要:尽管大语言模型的输出常被作为一种被称作“AI语言”的集体超级语言变体来分析,但本章认为,这一视角与类似于人类个人方言的、模型特有的独特语言特征并存。我们分析了两个关于社会议题的LLM生成文本数据集:一个是2024年的语料库(包含六个模型;Improta et al. 2024),另一个是使用相同提示词、涵盖六个当代模型的新生成的2026年语料库。我们利用计算描述符和文体计量主成分分析发现,2024年和2026年两组模型之间的文体存在代际转变,同时表明每个单独模型都保持独特的语言特征。这种多层交互通过缩约形式频率得以体现:在2026年同一批模型中,缩约形式频率从每百万词超过1,200次到超过30,000次不等。最后,我们得出结论:将LLM输出视为具有个人方言性质,为变异与变化研究、LLM生成文本检测、司法语言学以及基于使用的语言研究方法提供了一个具有潜在意义的框架。 ## 提交历史 来自:Thomas Stephan Juzek [查看邮箱 (https://arxiv.org/show-email/309f2afd/2608.06589)] **\[v1\]** 2026年8月6日星期四 21:03:13 UTC(1,061 KB)
相似文章
Linguistic Monoculture in LLM-Assisted Language Use
This paper introduces a mathematical framework to study how reliance on shared LLMs for writing may reduce population-level linguistic diversity, analyzing fixed, recursive, and personalized interaction mechanisms and characterizing equilibria and convergence rates.
大型语言模型有多像人类?一个关注语域的语言评估框架
本文提出了一种关注语域的语言评估框架,通过使用最大均值差异(MMD)比较人类与LLM生成文本中67个词汇语法特征的分布,来评估大型语言模型(LLM)的人类相似度。在七个经过指令微调的开源模型和五个语域上的实验表明,没有模型能完美匹配人类基线,且与人类语言的接近程度因语域而异,而非模型规模。
为了内容而内容
作者探讨了LLM如何影响编码和日常语言中的用词,发现LLM偏好的词汇在编程会话和Google Trends中出现的频率均有所增加,这引发了人们对人类开始采用LLM写作风格的担忧。
我们一直在分析人们如何在法律与合规任务中使用LLM(GDPR、AI法案等)。
对LLM在法律与合规任务中使用的分析显示,模型常常生成自信但无法验证的引用,引发了对AI输出可靠法律依据的质疑。
对齐更优,多样性下降?分析两代大语言模型的语法与词汇特征
这篇学术论文分析了两代大语言模型与人类撰写新闻文本相比的句法和词汇多样性,发现较新的对齐模型表现出多样性降低的现象。