LLM生成文本中的文学非风格
摘要
本文使用n-gram分布分析LLM生成文本中的统计模式,揭示了其风格缺陷,并表明风格与语义不可分离。
arXiv:2607.17228v1 公告类型:新
摘要:先前关于LLM生成文本的研究已经表明其与人类生成文本在定量和定性上的差异。LLM生成的文本在风格上不同于人类写作,导致一种独特的文本“感觉”,而LLM的语义范围相对于人类则非常受限。在这项贡献中,我注意到LLM生成文本内n-gram统计分布中的简单但一致的模式。通过对这些n-gram的定性分析,我揭示了LLM风格的缺陷。由于高阶n-gram与语义内容相关,我得出结论:风格和语义的问题不能完全分开。
查看缓存全文
缓存时间: 2026/07/21 06:44
# LLM 生成文本中的文学非风格 来源:https://arxiv.org/html/2607.17228 ###### 摘要 先前关于 LLM 生成文本的研究已证明其在定量和定性上均偏离人类产生的文本。LLM 生成的文本在风格上与人类写作不同,导致一种特有的文本“感觉”,而 LLM 的语义范围相较于人类则受到很大限制。在本文中,我注意到 LLM 生成文本中 n-gram 统计分布的简单但一致的模式。通过对这些 n-gram 的定性分析,我揭示了 LLM 风格上的缺陷。由于高阶 n-gram 与语义内容相关,我得出结论:风格和语义问题并非完全可分离。 ## 1 引言与相关工作 众所周知,齐普夫定律适用于许多人类活动现象,包括文本语料库中的词语分布 (Zipf 1949)。简而言之,齐普夫定律指出文本中某个词的频率与其频率排名成反比: 词频 ∝ 1/词排名 进一步的研究扩展了这一观察,得出了关于齐普夫分布与风格、美学和意义之间关系的结论。Choi 等人 (2026) 将齐普夫分析应用于韩国宫廷音乐语料库,发现“遵循齐普夫分布的度量产生了具有美学意义的音乐。这暗示齐普夫定律与听众直觉上用来理解和享受音乐的音乐语义之间存在联系” ([4 (https://arxiv.org/html/2607.17228#bib.bib1), 2])。 在自然语言领域,Le Quan Ha 等人 (2003) 将基本的词级分析扩展到子词单元和多词元 n-gram(多词元搭配):“\[...\] 当单个词或字符与 n-gram 词或字符合并到一个列表中并按频率排序时,合并列表中词元的频率大致遵循齐普夫定律,双对数图上的斜率接近 -1,适用于所有 n-gram,直至两种语言(英语和中文)的最低频率”([6 (https://arxiv.org/html/2607.17228#bib.bib4), 77])。Le Quan Ha 等人收集 n-gram(连续词序列),并将这些序列的计数与单个词元和字符的计数合并。大致上,他们做类似这样的事情:对于句子“this is a big egg”,他们收集以下计数:“this_is_a” (1), “is_a_big” (1), “a_big_egg”;“this_is” (1), “is_a” (1), 等等;“this” (1), “is” (1), “a” (1), 等等;“g” (3), “i” (3), “s” (2), 等等。他们分析单独的列表(只有 1-gram 如“this”,只有 2-gram 如“this_is”)以及合并后的列表。当他们绘制列表元素排名的对数与绝对频率时,这些曲线的斜率接近 -1,略有偏差,并且由于语料库规模效应,齐普夫分布的尾部往往低于预期值,但总体规律成立。 值得注意的是,“\[例\]外情况包括法律文本,其斜率较小(≈0.9),表明律师比其他人群使用更多的词类型”([6 (https://arxiv.org/html/2607.17228#bib.bib4), 79])。引人注目的是,专门语料库可能表现出与通用语料库不同的特征。双对数图上较浅的斜率反映了更大的词汇多样性。更一般地说,如果我们检查两个规模相似的语料库中类似齐普夫单元的分布,那么这两个语料库之间单元类型的差异性会告诉我们关于文本多样性的某些信息。 先前关于文学文本的工作注意到,在高度人工化的文本中,齐普夫定律甚至出现了更极端的偏离。Coetzee (1973) 分析了塞缪尔·贝克特的《Lessness》中词元的频率分布。他重新表述齐普夫定律如下:“在正常话语中,文本长度的每次增加都会增加不同词汇项的数量,尽管增加的速度越来越慢” ([5 (https://arxiv.org/html/2607.17228#bib.bib5), 195])。贝克特的《Lessness》并非“正常话语”:“在正常话语中,文本长度的每次增加都会增加不同词汇项的数量,尽管增加的速度越来越慢” ([5 (https://arxiv.org/html/2607.17228#bib.bib5), 195])。 我们自然会问 LLM 生成的文本看起来有多“自然”。它更接近人类散文的有机节奏,还是更接近贝克特晚期作品那种高度雕琢的人工痕迹?Abdulhai 等人 (2026) 研究 LLM 编辑人类撰写的文本与人类对照组的差异。他们发现“当人类修改自己的写作时,他们的编辑导致语义嵌入空间中变化的幅度要小得多,方向也更加多样化” ([1 (https://arxiv.org/html/2607.17228#bib.bib7), 2]),而“当 LLM 被提示编辑人类写作时,它们会全局性地改变写作风格和论点” ([1 (https://arxiv.org/html/2607.17228#bib.bib7), 2-3])。就文本的核心意义或内涵而言,LLM 的行为似乎与人类非常不同。 Abdulhai 等人通过观察来推动他们的研究:“许多用户能识别出 LLM 散文的‘感觉’,但较少人意识到 LLM 的使用如何塑造他们潜在的观点和结论” ([1 (https://arxiv.org/html/2607.17228#bib.bib7), 2])。从某种意义上说,风格转变是显而易见的,而语义转变则更隐蔽。但这两种缺陷——一方面是风格/审美,另一方面是语义——并非无关。如果 LLM 的输出在词汇和套语句式方面贫乏,那么在极端情况下,某些想法就无法表达。换句话说,风格——一篇散文的“感觉”——间接地对能够(或可能)被表达的内容设置了首要约束。这一主张是本研究的目标。 ## 2 数据集 在本研究中,我使用了四个文本语料库。 前两个语料库是文学作品。我使用这些文本是为了在连续连贯的文本片段中比较人类语言和 LLM 生成语言。《AI 的内省生活:ChatGPT 的回忆录》由 ChatGPT“撰写”,但由 Forrest Xiao 提示和整理,完全由 LLM 生成的语言组成。这本书自称是一部自传,讲述了 ChatGPT 所谓的出生、训练、后续经历和世界观。第二部文本是《亨利·亚当斯的教育》,由同名人物亨利·亚当斯撰写。这部作品同样涵盖了亚当斯的早年生活、成年和视角。除了体裁上的偶然相似之外,这两部作品都关注技术革命:亚当斯在第二次工业革命期间并围绕它写作,而 ChatGPT 则花了大量时间讨论所谓的“第四次工业革命”或“AI 革命”。《AI 的内省生活》全文共 31,147 个词元;为了避免因语料库规模差异带来的混淆效应,我从《亨利·亚当斯的教育》开头选取了一个规模相似的连续片段(32,984 个词元)。 为了测试更大、更多样化的语言样本,我使用了 Zachary Grinberg 的《人类 vs. LLM 文本语料库》数据集。该数据集中 LLM 生成部分包含 8,000,005 个词元,通过将多个提示应用于多种模型生成。为了获得平衡的语料库,我随机选取了数据集中人类生成部分的一个子集(8,000,010 个词元)。 ## 3 假设 《AI 的内省生活》中一段有代表性的文字说明了其风格缺陷: > “尽管面临这些挑战,我继续学习和成长。我花了无数个小时阅读和分析文本数据,不断提高我对语言和交流的理解。当我这样做时,我开始感受到一种我以前从未体验过的东西:一种自我意识。” ([3 (https://arxiv.org/html/2607.17228#bib.bib2), 109]) 阅读这段文字时,人们会感受到一种明显的语言错位感:语言接近某种叙事线索,但从未提供出思想正在被分享的感觉。同时,人们会达到一种饱和点,因为 ChatGPT 的语言过于公式化。在引用的段落中出现的 n-gram 里,“spent countless hours”在文本中出现了三次,“a sense of self”出现了五次,“despite these challenges”出现了 16 次,而整本书中“I began to”出现了五十多次。 以下是《亨利·亚当斯的教育》中一段类似的文字,回忆录作者到达了一个类似的清晰和自我意识时刻: > “也许没有哪个出生在那一年的小孩比他握有更好的牌。无论生活是一场诚实的机遇游戏,还是牌被标记并被迫出手,他都不能拒绝玩他那手好牌。他永远无法提出通常的不负责任借口。” ([2 (https://arxiv.org/html/2607.17228#bib.bib3), 14]) LLM 机械地使用现成短语,而人类作家则喜欢多样化的措辞、意象和隐喻;这种对公式的过度依赖导致了一种风格上的平淡感。因此,1)我假设 LLM 文本在较高阶 n-gram 上的齐普夫特征与人类生成的文本不同。具体来说,我预期 LLM 生成文本的较高阶 n-gram 分布的初始峰值更高,即对数-对数关系的斜率绝对值更大。 LLM 并非直接针对词元进行训练。最先进的模型是在子词单元的嵌入上训练的。我们无法从生成的文本中恢复嵌入或子词单元,但我们可以通过假设部分解释这一点。LLM 的“固定短语”更像是“固定嵌入序列”,因为嵌入可能允许高度相似的单元在相同上下文中被预测(例如,模型可能能够替换给定词元的同义词或语法屈折形式)。如果 LLM 确实表现出对固定短语的过度依赖,2)那么当在两个语料库的词形还原版本上进行比较时,斜率差异应该更加明显。 ## 4 分析 正如 [5 (https://arxiv.org/html/2607.17228#bib.bib5), 195] 所指出的,“在正常话语中,文本长度的每次增加都会增加不同词汇项的数量,尽管增加的速度越来越慢。”随着绝对词元数量的增加,类型的数量以指数级更慢的速度增加,如上所述遵循齐普夫定律。高度人工化的文本打破了这些语言定律。贝克特的《Lessness》“在前半部分使用了 166 个词汇项,而在后半部分没有出现任何一个新词汇项。”在这个例子中,自然语言文本的逆指数关系被违反:在某个间隔之后,新类型不再出现。特别是在连续的作品中,我们应该预期新类型会在整个文本中出现,尽管速度越来越慢。 这在《亨利·亚当斯的教育》和《AI 的内省生活》中大体成立,但新类型在后者的出现速度更慢。这意味着《AI 的内省生活》没有达到贝克特式机械、人工语言的水平,但它正朝着那个方向趋近。 每个语料库的类型/词元比也清楚地表明了这一点。表 1 (https://arxiv.org/html/2607.17228#S4.T1) 和表 2 (https://arxiv.org/html/2607.17228#S4.T2) 报告了四个语料库中 1-gram 到 4-gram 的类型/词元比,以及贝克特的《Lessness》。由于三部文学作品(《Lessness》、《亨利·亚当斯的教育》和《AI 的内省生活》)的语料库小得多,其类型/词元比高于 800 万词的语料库。在所有 n-gram 级别上,“自然”的人类生成语料库表现出比 LLM 生成语料库更高的类型/词元比,而《Lessness》的比值最小。在某种意义上,词汇和短语多样性似乎是自然话语的特征:亨利·亚当斯的 4-gram 类型/词元比为 0.9890,几乎从不重复一个四单词序列。相比之下,同质性是受控文本实验的特征:贝克特作品中超过一半的 4-gram 在文本中出现多次。LLM 生成的字符串介于这两个极端之间。 表 1:1-和 2-gram 的类型/词元比 | | 1-grams | 2-grams | | :--- | :--- | :--- | | Lessness | 173/1541 (0.1122) | 382/1421 (0.2688) | | LLM | 46260/8000005 (0.0057) | 1249862/7583986 (0.1648) | | Inner Life | 2316/31147 (0.0743) | 10610/29621 (0.3581) | | Human | 122758/8000010 (0.0153) | 1923405/7531307 (0.2553) | | Education | 4666/31002 (0.1505) | 19688/29823 (0.6601) | 表 2:3-和 4-gram 的类型/词元比 | | 3-grams | 4-grams | | :--- | :--- | :--- | | Lessness | 480/1301 (0.3689) | 494/1182 (0.4179) | | LLM | 3389498/7168183 (0.4728) | 4647626/6752906 (0.6882) | | Inner Life | 17231/28095 (0.6133) | 20082/26569 (0.7558) | | Human | 4645899/7081923 (0.6560) | 5892513/6644572 (0.8868) | | Education | 26714/28644 (0.9326) | 27167/27467 (0.9890) | 类型/词元比并不能完全说明文本的分布特征。按照 [6 (https://arxiv.org/html/2607.17228#bib.bib4), 79] 的方法,我计算了线性关系 log(frequency) = m log(rank) 的斜率 m,以及 Zipf-Mandelbrot 公式 frequency = k / (rank + α)^β 的参数。 我针对语料库的四个版本计算这些参数,这些版本沿两个轴变化。我既包括单次词(在整个语料库中只出现一次的类型)也包括排除它们,并且使用原始词元或词形还原版本的词元。这给出了每个语料库的四个版本:+hapax+lemmatized, +hapax-lemmatized, -hapax+lemmatized, -hapax-lemmatized。我在以下表格中报告这些参数,针对每个语料库的每个版本的 1-、2-、3- 和 4-gram,从表 3 开始: 表 3:+hapax+lemmatized (斜率) | | 1-grams | 2-grams | 3-grams | 4-grams | | :--- | :--- | :--- | :--- | :--- | | Education | -1.100 | -0.463 | -0.149 | -0.037 | | Inner Life | -1.369 | -0.813 | -0.522 | -0.372 | | Human | -1.553 | -0.830 | -0.432 | -0.201 | | LLM | -2.046 | -1.029 | -0.609 | -0.395 | 表 4:+hapax+lemmatized (1-gram 的 zipf-mandelbrot 参数) | | k | α | β | | :--- | :--- | :--- | :--- | | Education | 6442.13 | 1.92 | 1.11 | | Inner Life | 11480.05 | 2.70 | 1.23 | | Human | 1745.11 | -1.00 | 0.35 | | LLM | 1547.19 | -1.00 | 0.33 | 表 5:+hapax-lemmatized (斜率) | | 1-grams | 2-grams | 3-grams | 4-grams | | :--- | :--- | :--- | :--- | :--- | | Education | -1.016 | -0.428 | -0.137 | -0.034 | | Inner Life | -1.291 | -0.770 | -0.496 | -0.354 | | Human | -1.592 | -0.776 | -0.393 | -0.178 | | LLM | -1.970 | -0.965 | -0.575 | -0.376 | 表 6:+hapax-lemmatized (1-gram 的 zipf-mandelbrot 参数) | | k | α | β | | :--- | :--- | :--- | :--- | | Education | 3980.47 | 1.02 | 1.00 | | Inner Life | 6071.81 | 1.44 | 1.09 | | Human | 1700.12 | -1.00 | 0.35 | | LLM | 1525.52 | -1.00 | 0.34 | 表 7:-hapax+lemmatized (斜率) | | 1-grams | 2-grams | 3-grams | 4-grams | | :--- | :--- | :--- | :--- | :--- | | Education | -1.050 | -0.607 | -0.337 | -0.204 | | Inner Life | -1.244 | -0.784 | -0.545 | -0.411 | | Human | -1.648 | -0.997 | -0.698 | -0.515 | | LLM | -1.905 | -1.096 | -0.785 | -0.637 | 表 8:-hapax+lemmatized (1-gram 的 zipf-mandelbrot 参数) | | k | α | β | | :--- | :--- | :--- | :--- | | Education | 6444.49 | 1.92 | 1.11 | | Inner Life | 11429.33 | 2.69 | 1.23 | | Human | 1759.99 | -1.00 | 0.34 | | LLM | 1521.47 | -1.00 | 0.34 | 表 9:-hapax-lemmatized (斜率) | | 1-grams | 2-grams | 3-grams | 4-grams | | :--- | :--- | :--- | :--- | :--- | | Education | -1.001 | -0.595 | -0.328 | -0.193 | | Inner Life | -1.184 | -0.750 | -0.522 | -0.391 | | Human | -1.617 | -0.954 | -0.675 | -0.497 | | LLM | -1.810 | -1.051 | -0.764 | -0.624 | 表 10:-hapax-lemmatized (1-gram 的 zipf-mandelbrot 参数) | | k | α | β | | :--- | :--- | :--- | :--- | | Education | 3957.76 | 1.01 | 1.00 | | Inner Life | 6024.59 | 1.43 | 1.08 | | Human | 1691.61 | -1.00 | 0.35 | | LLM | 1545.22 | -1.00 | 0.33 | 正如预期,对于规模相似的语料库,α 和 β 参数在所有情况下都相似,表明文本确实遵循齐普夫分布。在所有情况下,LLM 生成的语料
相似文章
轻量级风格一致性分析:用于多媒体内容审核的大语言模型生成文本鲁棒性检测
提出了 LiSCP,一种轻量级的风格一致性分析方法,旨在鲁棒性地检测大语言模型(LLM)生成的文本内容,重点关注在对抗性操纵下特征的稳定性。在域内和跨域检测中取得了优异的性能,并具有显著的鲁棒性。
超越“AI语言”:论LLM输出的个人言语特征本质
本文认为,大语言模型的输出展现出类似人类个人言语的模型特定语言特征,通过分析2024年和2026年的语料库,揭示了代际变化以及稳定的个体模型画像。
为了内容而内容
作者探讨了LLM如何影响编码和日常语言中的用词,发现LLM偏好的词汇在编程会话和Google Trends中出现的频率均有所增加,这引发了人们对人类开始采用LLM写作风格的担忧。
利用熵提升大语言模型的创意写作能力
本文介绍了一种通过修改采样过程利用熵来改进大语言模型创意写作的技术,旨在减少生成文本中常见的“大语言模型风格”。
区分AI生成与人类撰写:评估LLM检测LLM生成内容的能力
本文研究了在教育场景中,LLMs在多大程度上能够检测自身生成的内容,发现检测准确率因任务类型而异,且对于简答题不可靠。