语言模型生成的小说在形式变化上呈现压缩
摘要
本文分析了与人类创作的小说相比,大语言模型生成的小说是否表现出压缩的形式变化。研究发现,尽管个体小说在风格上接近人类,但AI输出在句子结构、可读性和标点方面更为统一。
arXiv:2608.12630v1 公告类型:新
摘要:虽然大语言模型可以生成整部小说,但关于其在多次生成中输出形式变化水平的信息却很少。本研究不是追问单个段落能否被识别为AI生成,而是探究重复的AI生成是否能够产生与人类语料库中相同范围的多样性。本文对比了基于生成来源和目标风格的六个语料库:使用GPT-5.5 Thinking以十九世纪英国现实主义风格生成的二十部小说,使用Qwen3-14B以十九世纪英国现实主义风格生成的二十部小说,使用这两个模型分别以当代零风格生成的各二十部小说,205部十九世纪人类创作的英国小说,以及65部当代人类创作的零风格小说。在文档层面,研究采用了MATTR-500、香农熵、平均句长、可读性和标点频率等测量指标。最稳健可靠的结果是句子结构的压缩。重复生成产生的小说在句子结构上彼此之间的差异远小于人类小说。压缩也体现在可读性、标点以及小说内部句长变异性等测量中。词汇测量通常也呈现类似的压缩,但Qwen零风格MATTR除外。尽管GPT和Qwen具有不同的平均风格特征,但二者缺乏跨测量相关性的稳定模式。本文因此区分了代表小说间形式范围有限的方差过度闭合,以及更具体的相关性过度闭合现象。这意味着个别AI生成的小说可能在风格上接近人类小说,而一组AI生成的小说则占据着狭窄得多的形式范围。
查看缓存全文
缓存时间: 2026/08/14 09:26
# 语言模型生成的小说呈现压缩的形式变异 来源:https://arxiv.org/html/2608.12630 Mehdy Sedaghat PayamJustin Quinn 单位:西波希米亚大学单位:查理大学 邮箱:[jquinn@fpe\.zcu\.cz](mailto:) ###### 摘要 虽然大型语言模型能够生成整部小说,但关于它们多次生成输出中的形式变异水平,目前信息甚少。本研究不追问个别段落能否被识别为AI生成,而是追问重复的AI生成是否能够产生与人类语料库中相当范围的多样性。本文对比了六个基于生成来源和目标风格划分的语料库:使用GPT-5.5 Thinking生成的二十部十九世纪英国现实主义风格小说,使用Qwen3-14B生成的二十部十九世纪英国现实主义风格小说,分别使用上述两种模型以当代“零度风格”生成的各二十部小说,205部十九世纪人类写作的英国小说,以及65部当代人类写作的零度风格小说。在文档层面,研究包括MATTR-500、香农熵、平均句长、可读性和标点使用率测量。最稳健且最可靠的结果是句子结构的压缩。重复生成产生的小说彼此之间的句子结构差异远小于人类小说。压缩同样存在于可读性、标点以及小说内部句长变异性的测量中。词汇测量也倾向于同样被压缩,但Qwen零度风格MATTR除外。尽管GPT和Qwen具有不同的平均风格轮廓,它们却缺乏跨测量相关的稳定模式。因此,本文区分了方差过度封闭(代表小说之间有限的形式范围)与一种更具体的现象——相关过度封闭。这意味着单个AI生成的小说可能在风格上接近人类小说,而一批AI生成的小说则占据一个狭窄得多的形式范围。 关键词:AI生成小说;文体计量学;零度风格;词汇多样性;句长;方差;过度封闭 ## 1 引言 ### 1.1 从表层叙事到语料库结构 大型语言模型现在能够生成在语言上具有“连贯性”且风格上“无标记”的文本,这一观点来自德国哲学家和文学学者Hannes Bajohr。他用“表层叙事”指代这种可识别的叙事类型:当连贯的序列给人因果和时间连续之感时,表层叙事便会出现。尽管“表层叙事”突出了AI叙事中的一个重要元素,但它关注的是故事中衔接与连贯之间的联系,而非对机器作者身份的取证检测——后者属于文体计量学的领域(Bajohr 2024)。这一领域的文体计量学研究已经发现,人类写作的文本与AI生成的短文本在词汇、句法、语法和标点方面仍然存在差异(Kobak et al. 2025; O’Sullivan 2025; Pawłowski and Walkowiak 2026; Przystalski et al. 2026)。本文提出这些研究尚未涉及的另一问题:在整部小说的规模上,即LLM必须在数万字中持续维持模式时,形式差异是否仍然存在?小说不仅仅是加长的短文本。它要求模型反复作出关于词汇更新、句子节奏、可读性、标点及其相互作用的风格决策¹¹¹有时,作家会根据深思熟虑的预定决定来选择特定的特征组合,以构建个人风格(例如海明威),批评家如William Gass(1985, p. 150)也根据这些预定决定对作家进行分类。。模型产生的小说可以流畅且风格多变;然而,一组生成的小说所覆盖的形式变异可能远少于一组人类写作的小说。这里重要的不是单个句子或段落,而是小说彼此之间的变异程度,以及形式属性是否保持独立。本文的目的不是判断短段落的作者是AI还是人类。相反,目标是看AI写作小说的语料库广泛多样性是否与两个选定的人类比较语料库相匹配。研究还将评估所观察到的模式是仅限于特定生成系统,还是可以在不同模型设置中看到。为此,本研究考察了通过ChatGPT界面使用GPT-5.5 Thinking生成的小说,以及通过独立记录的Google Colab工作流使用Qwen3-14B生成的小说。 ### 1.2 超越文体计量检测的贡献 最近最接近的研究是O’Sullivan(2025),他比较了人类生成和AI生成的创意写作,表明短文本的风格可以与人类写作区分开来。本研究与O’Sullivan之间有五个差异。第一,本研究关注完整小说而非短篇创意文本。第二,每部小说被作为文档层面的独立观察,而非按其类型分类。第三,本研究以小说之间的离散度和特征协调性作为因变量。第四,通过匹配生成组和人类组在每次生成-人类比较中的重采样规模来估计不确定性。第五,本研究探讨主要发现是否适用于两种不同的模型设置,而非只关注某一特定模型界面工作流的输出。 ### 1.3 跨文本尺度的同质化 近期研究已在多个文本和社会尺度上识别出AI生成文化产品中的趋同现象。Anderson et al.(2024)研究了人们在语言模型辅助下的构思过程中的同质化。Agarwal et al.(2025)证明AI写作建议在文化社群内部和之间促成了风格趋同,并将文化决定的写作风格引向西方式风格。在叙事层面,Rettberg和Wigers(2025)观察到,为不同国家语境创作的故事总是重复相似的回家、传统、社区组织和和解情节。类似地,Wilkens(2026)观察到同质化基于生成设计;简单提示产生同质的章节,而带有个性化合成传记的复杂提示则在嵌入空间中生成多样性。这些研究关注相关但不同的现象。这里,我们关注文本组织的另一方面:当考虑多部小说时出现的形式分布。生成的小说是否在文档层面的风格特征上形成压缩分布?在人类小说中相对独立的特征是否在生成文本中变得更加协调?GPT-5.5 Thinking和Qwen3-14B的共存使我们能够确定这些倾向是仅出现在某一模型-界面配置中,还是存在于两种不同生成过程之间。两个模型之间的一致性将意味着形式压缩并非ChatGPT所独有。然而,这种一致性本身并不能证明过度封闭在语言模型中的普遍性或固有性。研究结果仍然限于所考虑的具体模型、界面、提示、主题和生成过程。因此,形式范围是一个分析视角。它比特定段落的局部连贯性更宽泛,但并不涵盖情节、人物发展、聚焦、文化描绘或叙事意义的全部范围。 ### 1.4 形式范围与过度封闭 人类文学语料库不仅在风格特征的平均值上有所不同,而且在离散度以及这些特征之间的关系上也有所不同(Eder 2017; Eder et al. 2016; Stamatatos 2009)。例如,两位作者可能通过不同的句子结构表现出相似的词汇多样性水平,或者两部可读性几乎相同的小说可能以不同方式使用标点和词汇。这种相对独立性赋予文学语料库多样的形式范围。在本文中,当我们说“形式范围”时,我们特指我们所测量的风格特征之间的离散度和协调性;我们不是指情节、人物塑造、视角或整体叙事结构。过度封闭描述的是语料库层面的条件:生成的文本在局部保持流畅和连贯,但在所测量的形式维度上表现出异常受限的倾向。“方差过度封闭”意味着小说之间在词汇多样性、熵、句长或可读性等特征上差异非常小。“相关过度封闭”是一个探索性假设,涉及那些在机械上并不相关但在生成文本中比在人类比较语料库中更强烈地协调起来的特征。这两类过度封闭彼此不同:一个语料库可以受到限制而其变量并不相互依赖,或者反过来,变量可以相互依赖而不必所有变量都以相同程度压缩。过度封闭并不意味着文本简单、低质量或词汇薄弱。一个语料库可能具有较高的平均词汇多样性,但小说之间仍然差异很小。这个术语也不描述单独一个文本;相反,它描述的是在类似条件下产生的一整组文本的模式。 ### 1.5 研究问题 RQ1. 四种生成条件是否在其对应的人类比较语料库中表现出较低的小说间离散度? RQ2. 在控制文档数量、作者身份、时期和篇幅之后,任何观察到的压缩是否仍然存在? RQ3. 在每个风格目标内,GPT和Qwen是否占据相似或不同的平均风格位置? RQ4. 跨特征相关是否在模型和风格条件之间显示出可复制的模式? 主要比较在语料库层面进行,每种生成条件与对应的人类语料库进行比较。该设计并不试图估计AI生成作品、提示或模型架构的任何一般效应。相反,它试图估计重复的模型-工作流组合所创建的形式范围,与所选人类多作者语料库的形式范围相比。它并不试图估计AI生成的小说是否比单个人类作者的作品具有更低的变异性。分析区分了三个不同级别的量化证据。第一个是生成的小说是否在所测量的形式特征方面表现出更小的小说间方差。第二个涉及比较GPT和Qwen的风格位置平均值。最后,跨特征相关被视为探索性分析,即对于所有模型和风格目标,特征之间是否存在任何协调模式。细读部分是这一分析的定性对应物,考察语料库压缩是否在单个小说中可被检测到。 ## 2 语料库与方法 ### 2.1 六语料库比较设计 本研究使用六个语料库,它们按两个主要概念维度分类:生成来源和风格目标。在生成来源方面,区分人类写作的小说与GPT-5.5 Thinking和Qwen3-14B写作的小说。在风格目标方面,区分以十九世纪风格(维多利亚小说)写作的小说和以当代、易读且风格标记较低的“零度风格”写作的小说。结果产生两个人类比较语料库和四种生成条件。 表1:语料库构成和文档长度分布。 ### 2.2 十九世纪英国人类语料库 历史比较语料库取自“维多利亚小说”收藏,由名为“时代密码”(Ciphers of the Times, 2022)的项目提供。在排除二十世纪文本后,剩余205部作品,出版时间在1800年至1900年之间。由于这一时间跨度始于维多利亚女王登基之前,我们将此语料库命名为“十九世纪英国人类”而非“维多利亚人类”。该收藏包括121位作者的作品,跨越不同年代、各种亚体裁、不同叙事风格、不同文本长度以及不同的知名度和文学地位。这是一个历史广泛且具体的样本,不应被视为人类文学价值的普遍标准。该语料库的广度使我们能够测量文本中的压缩程度;同时,应当指出,该语料库受到诸如书籍数字化方式、公共领域作品可用性以及哪些作品随时间被视为重要等因素的影响(Ciphers of the Times 2022; Jockers 2013; Moretti 2013; Underwood 2019)。 ### 2.3 零度风格人类语料库 当代人类语料库包括65部由Justin Quinn根据其零度风格定义选择的小说,零度风格指追求全球可读性和语言可及性以及低风格标记的散文(Quinn 2025)。完整书名列表见补充表S2。尽管该语料库包含多位作家的作品,但并非所有作家在该语料库中的小说数量都相同;例如,哈金的小说有八部,郭小橹的小说有六部,而有些作家只选了一部。下文所使用的规模匹配人类子抽样减少了单个作者对整个语料库的影响。 ### 2.4 GPT语料库 GPT语料库通过ChatGPT界面使用GPT-5.5 Thinking生成。这一过程始于2026年5月初,结束于2026年6月中旬,大约每天生成一部小说。这些小说的生成不是单一步骤,而是交互式且连续地进行的:首先请求章节大纲和小说第一章。然后用户通过连续命令在多个连续回合中获得小说的其余部分。关于用户界面的信息,如模型的创造力设置(温度)、top-p值、用于采样的随机种子、后端系统的确切版本、系统提示或上下文和记忆的管理方式,均未透露。因此,本研究只是模型、用户界面和提示方法的组合,而非语言模型本身。本文的任何结论都不依赖于了解这些隐藏参数,我们也不将观察到的模式归因于模型的任何特定内部机制。 GPT维多利亚提示要求以下特征:标准的十九世纪英国英语,全知叙述偶尔使用“自由间接话语”技巧,对人物之间的社会互动进行详细且现实主义的描写,避免直接模仿特定具名作者的风格或使用1900年以后的任何内容。这些提示特别要求句子在长度和节奏上有所变化,即长句、多部分句子和短句应并存。此外,故事的社会世界必须是
相似文章
@rohanpaul_ai: 大型语言模型可能不需要人类风格的语言。即,未来的人工智能系统可能会通过使用密集的、模型可读的消息来节省上下文空间,而不是冗长的常规散文。
本文介绍了BabelTele,一种压缩写作风格,通过使用缩写、符号和多语言片段将文本长度减少72.1%,同时为LLM保留了99.5%的语义保真度,论证了人类可读性与机器可恢复性是可分离的。
大型语言模型总是讲相同的故事吗?
本文研究大型语言模型是否能够生成多样化的故事。通过叙事相似性分析,作者发现,LLM生成的叙事彼此之间的相似度始终高于人类撰写的故事,而常见的缓解策略(如负面提示和温度缩放)未能解决这种同质化问题。
超越“AI语言”:论LLM输出的个人言语特征本质
本文认为,大语言模型的输出展现出类似人类个人言语的模型特定语言特征,通过分析2024年和2026年的语料库,揭示了代际变化以及稳定的个体模型画像。
LLM生成文本中的文学非风格
本文使用n-gram分布分析LLM生成文本中的统计模式,揭示了其风格缺陷,并表明风格与语义不可分离。
对齐更优,多样性下降?分析两代大语言模型的语法与词汇特征
这篇学术论文分析了两代大语言模型与人类撰写新闻文本相比的句法和词汇多样性,发现较新的对齐模型表现出多样性降低的现象。