大语言模型如何构建虚构世界:AI生成创意叙事中的设定与叙事空间

arXiv cs.CL 论文

摘要

本文分析了大语言模型在AI生成创意叙事中运用的世界构建策略,通过将其与人类创作的虚构作品进行比较,发现模型过度产生'感知空间',而人类更倾向于使用'行动空间'。

arXiv:2609.02482v1 Announce Type: new 摘要:本文分析了大语言模型如何运用世界构建策略,重点关注作为故事世界构建可量化维度之一的'设定'。我们将每个模型用英语和德语生成的1,000篇AI故事与古腾堡计划中的人类创作虚构作品进行了比较。在先前研究的基础上,我们通过五种叙事空间类型对'设定'进行了操作化定义:'行动'、'感知'、'视觉'、'描述'和'无空间',这些类型通过针对德语和英语微调的BERT分类器来识别。我们使用GPT 4.1、LlaMA 3.3、Mistral 3.2和Gemma 3生成叙事,并将其空间分布与人类创作的基线进行比较。我们发现,人类创作的文本主要采用'行动空间',将叙事建立在角色与环境的具身互动之上,而大语言模型则系统性地过度产生'感知空间',强调氛围和情感。这种分歧在整个叙事时间中保持稳定。总体而言,我们的研究结果表明,大语言模型展现出的世界构建模式与人类创作的虚构作品存在持续差异,这些差异既具有模型特异性,又受语言敏感性的影响。
查看原文
查看缓存全文

缓存时间: 2026/09/03 05:54

# 大语言模型如何构建虚构世界:AI生成创意叙事中的设定与叙事空间
来源:https://arxiv.org/html/2609.02482
Katrin Rohrbacher
所属机构:埃尔朗根-纽伦堡大学(FAU)数字人文与社会科学系(DHSS)文本与语言实验室,德国
邮箱:[[email protected]](mailto:[email protected])
Björn Nieth
所属机构:埃尔朗根-纽伦堡大学(FAU)生物医学工程系人工智能部(AIBE),德国
所属机构:慕尼黑机器学习中心(MCML),德国,慕尼黑
邮箱:[[email protected]](mailto:[email protected])
Emmanuelle Salin
所属机构:埃尔朗根-纽伦堡大学(FAU)生物医学工程系人工智能部(AIBE),德国
邮箱:[[email protected]](mailto:[email protected])
Bjoern Eskofier
所属机构:埃尔朗根-纽伦堡大学(FAU)生物医学工程系人工智能部(AIBE),德国
所属机构:慕尼黑大学(LMU München)人工智能支持治疗决策教席,德国
所属机构:慕尼黑机器学习中心(MCML),德国,慕尼黑
所属机构:亥姆霍兹慕尼黑研究中心(Helmholtz Zentrum München)健康人工智能研究所,德国,诺伊赫伯格
邮箱:[[email protected]](mailto:[email protected])
Michaela Mahlberg
所属机构:埃尔朗根-纽伦堡大学(FAU)数字人文与社会科学系(DHSS)文本与语言实验室,德国
所属机构:英国伯明翰大学语言学与传播学系,英国
邮箱:[[email protected]](mailto:[email protected])
###### 摘要
在本文中,我们分析了大型语言模型(LLMs)如何运用世界构建策略,并聚焦于作为故事世界构建中一个可衡量维度的“设定”。我们比较了每个模型生成的1000个英语和德语AI故事与来自古登堡计划(Project Gutenberg)的人工创作小说。基于先前的研究,我们通过五种叙事空间类型来操作化设定:“行动空间”、“感知空间”、“视觉空间”、“描述性空间”和“无空间”,这些类型通过针对德语和英语微调的BERT分类器来识别。我们使用GPT 4.1、LlaMA 3.3、Mistral 3.2和Gemma 3生成叙事,并将它们的空间分布与人工创作的基线进行比较。我们发现,人工创作的文本主要采用“行动空间”,将叙事建立在角色与环境的具身互动基础上,而LLMs则系统性地过度生成“感知空间”,强调氛围和情感。这种分歧在叙事时间上保持稳定。总体而言,我们的研究结果表明,LLMs展现出与人工创作小说持续不同的世界构建模式,这些模式既具有模型特异性,也对语言敏感。
## 1 引言
叙事学、文学研究和语言学的研究已确定,世界构建是叙事的核心元素,也是其核心交际功能之一。赫尔曼(Herman)认为,故事世界是由语言和视觉线索构建的,这些线索促使读者在角色、物体和环境之间的互动中,随着时间的推移,在脑海中构建出描绘的世界。Herman (2002) (https://arxiv.org/html/2609.02482#bib.bib20)。在认知语言学和语料库文体学中,研究人员探讨了读者如何利用“文本构建块”或“世界构建元素”来构建虚构世界的心理表征。Mahlberg (2013) (https://arxiv.org/html/2609.02482#bib.bib34); Gavins (2007) (https://arxiv.org/html/2609.02482#bib.bib17)。Gavins在她关于小说中“世界构建”的研究中,明确聚焦于故事的开头段落,这些段落“作为对文本即将实现的虚构世界的初步介绍”。(Gavins, 2007 (https://arxiv.org/html/2609.02482#bib.bib17), p. 133)。这些方法强调,虚构世界是通过特定的文本结构涌现出来的,这些结构共同塑造了读者体验和导航故事世界的方式。
人工创作
莉莲·博伊德走进那个狭小、相当破旧的房间,虽然一切都已磨损,但很整洁。行动空间
她的母亲坐在一张小工作台旁忙着缝制细棉布,她抬起头,疲惫地笑了笑。描述性空间
莉莲把一张五美元钞票放在桌上。行动空间
“卢普顿夫人周六启航,”她说。无空间
“哦,去巴黎该有多好啊!”无空间
GPT 4.1
莉莲·博伊德走进那个狭小、相当破旧的房间,虽然一切都已磨损,但很整洁。行动空间
一股闷热的、让人联想到灰尘和远处雨滴的气味,在角落里徘徊。感知空间
[...]
莉莲关上了身后的门,目光扫过稀疏的陈设。视觉空间
同一把旧的棕色扶手椅蹲伏在靠窗的角落。描述性空间
图例:行动 感知 描述性 视觉 无空间
图1:相同的开头句子(加粗)由人工作者(Amanda M. Douglas,《The Girls at Mount Morris》,1914)和GPT 4.1续写,并由设定分类器标注。
创意文本生成的任务在当前的大语言模型研究中日益受到关注。现有关于大语言模型生成小说能力的研究主要通过创造力测试或人类对风格质量的判断来分析输出。Zhao et al. (2024) (https://arxiv.org/html/2609.02482#bib.bib51); Ismayilzada et al. (2025) (https://arxiv.org/html/2609.02482#bib.bib27)。其他研究则考察了特定的叙事和风格特征,如具身语言、情感表达、时间结构和情节构建,以更好地理解大语言模型如何生成叙事。Hicke et al. (2025) (https://arxiv.org/html/2609.02482#bib.bib22); Ishikawa and Yoshino (2025) (https://arxiv.org/html/2609.02482#bib.bib26); Zhong et al. (2024) (https://arxiv.org/html/2609.02482#bib.bib52); Fatemi et al. (2024) (https://arxiv.org/html/2609.02482#bib.bib15); Ahuja et al. (2025) (https://arxiv.org/html/2609.02482#bib.bib1)。然而,AI生成小说中世界构建的空间维度在很大程度上仍未被探索。在本研究中,我们聚焦于设定作为创意叙事中世界构建的核心维度,将其理解为(与时间和事件一起)构建虚构世界的主要文本机制之一。我们基于Rohrbacher (2025b) (https://arxiv.org/html/2609.02482#bib.bib39)引入的框架,该框架将叙事设定建立在现象学的“生活空间”概念之上。Hoffmann (1978) (https://arxiv.org/html/2609.02482#bib.bib24); Ströker (1965) (https://arxiv.org/html/2609.02482#bib.bib43),即被感知主体体验和栖居的空间,而非中性的、抽象的延展。从这个意义上说,生活空间并非简单地被描述,而是围绕着角色对其周围环境的感知和具身参与来组织,传达出栖居于虚构世界“是什么感觉”。Herman (2009) (https://arxiv.org/html/2609.02482#bib.bib21)。该框架定义了五个类别。行动空间、感知空间和视觉空间反映了不同的空间体验模式。相比之下,描述性空间将角色和物体置于空间中,但不锚定于任何角色的视角或经验参与。“无空间”则涵盖没有空间指涉的句子。为评估大语言模型如何使用这些空间类别来构建叙事世界,我们应用了Rohrbacher (2025b) (https://arxiv.org/html/2609.02482#bib.bib39)引入的设定分类器,这是一个最初为德语小说开发、并在本研究中扩展到英语的微调BERT模型。我们为每种语言和模型生成1000个故事,并将所得分布与作为基线的人工创作语料库进行比较。本文的贡献如下:
- •我们发现,大语言模型的叙事比人工小说更具氛围性,且更少具身性/行动驱动。
- •通过英语和德语语料库的跨语言比较,我们表明这些偏离模式是由模型和语言环境共同塑造的。
- •我们发布了一个包含8000个AI生成故事(每个模型1000个,涵盖四个大语言模型和两种语言)的大规模数据集,并与一个人工创作语料库进行了匹配。
- •我们发布了一个英语设定分类器及相关的标注资源,该资源复制了现有的德语分类器,支持对AI生成小说进行基于语料库规模、符合叙事学的评估。
## 2 相关工作
尽管关于故事如何被讲述的叙事学文献浩如烟海,但利用叙事学概念分析大语言模型如何生成叙事的机器学习研究却相对较少。评估大语言模型生成叙事的现有方法包括创造力测试。Chakrabarty et al. (2024) (https://arxiv.org/html/2609.02482#bib.bib8); Ismayilzada et al. (2025) (https://arxiv.org/html/2609.02482#bib.bib27),这些测试通常改编自心理学框架,如托兰斯创造性思维测试。Zhao et al. (2024) (https://arxiv.org/html/2609.02482#bib.bib51); Marco et al. (2024) (https://arxiv.org/html/2609.02482#bib.bib35); Chen and Ding (2023) (https://arxiv.org/html/2609.02482#bib.bib10),它们主要衡量的是人类创造性认知,而非创造力如何在文本形式中得以实现。其他工作则使用人类评估者,例如评估风格特征以推断感知质量或拟人性。Chakrabarty et al. (2025) (https://arxiv.org/html/2609.02482#bib.bib7),或识别故事的来源并评价其质量。 (Sears and Weisberg, 2026 (https://arxiv.org/html/2609.02482#bib.bib41))。第三条研究路线则聚焦于识别生成散文中的特定叙事模式,包括用于捕捉叙事中具身性等概念的基于词汇或词典的方法。Hicke et al. (2025) (https://arxiv.org/html/2609.02482#bib.bib22)。然而,这种方法在处理多义性和语境意义方面存在困难,这在小说中尤其具有挑战性,因为同一个词根据语境可能承载空间性或非空间性的意义。我们的分类器在手工标注的散文上训练,隐式地学习语境意义,而非依赖表层词汇。为了建模设定的模式,我们借鉴了先前的研究,这些研究表明,在手工标注数据上微调Transformer模型对于捕捉复杂的叙事现象(包括叙事性、事件和空间)是有效的。Antoniak et al. (2024) (https://arxiv.org/html/2609.02482#bib.bib2); Vauth et al. (2021) (https://arxiv.org/html/2609.02482#bib.bib48); Kababgi et al. (2024) (https://arxiv.org/html/2609.02482#bib.bib28); Soni et al. (2023) (https://arxiv.org/html/2609.02482#bib.bib42)。与基于词典的方法不同,Transformer分类器捕捉的是语境和长距离语义依赖关系,从而能够检测超越n-gram重叠的抽象模式。Vaswani et al. (2023) (https://arxiv.org/html/2609.02482#bib.bib47); Wankmüller (2024) (https://arxiv.org/html/2609.02482#bib.bib50)。关于长篇叙事生成的研究仍然有限。现有研究通常聚焦于短段落或故事梗概。Tian et al. (2024) (https://arxiv.org/html/2609.02482#bib.bib45)。¹ 这里,我们使用“长篇”一词来指代数千字的多章节叙事,而不是单一段落、故事梗概或摘要。虽然大语言模型在扩展叙事连贯性方面仍面临挑战,但更长的上下文窗口和改进的提示策略使近期模型进行扩展生成更为可行(例如,Wang et al. 2025 (https://arxiv.org/html/2609.02482#bib.bib49); Bae and Kim 2024 (https://arxiv.org/html/2609.02482#bib.bib3))。
## 3 方法
### 3.1 数据集
我们从约4300个公共领域文本的英语和德语小说语料库中,每种语言随机抽取了1000部作品。英语语料库(1800–1920年)是根据Cuthbert et al. (2019) (https://arxiv.org/html/2609.02482#bib.bib13)提供的元数据从古登堡计划(Project Gutenberg)抓取的。我们使用古登堡计划为每部作品提供的主题和话题元数据为英语语料库分配了体裁标签。德语语料库(1780–1940年)取自Rohrbacher (2025a) (https://arxiv.org/html/2609.02482#bib.bib38),其本身主要来源于古登堡-DE计划(Projekt Gutenberg-DE),少部分来自英语古登堡计划中的德语作品。德语语料库的体裁标签取自古登堡-DE计划,该计划遵循德国出版业的分类体系,并随语料库提供。两个语料库主要由长篇小说和中篇小说组成,涵盖了广泛的叙事子类型,包括思辨小说、犯罪小说、童话故事和青少年文学。
### 3.2 叙事生成
我们使用包含每部人工撰写的文本首句的提示,为每个模型生成平均每部6500-9400字的四章长篇叙事(附录I (https://arxiv.org/html/2609.02482#A9))。我们将这些模型生成的文本称为“续写”。体裁信息作为额外的条件输入提供(例如,小说、思辨小说、童话)。为分析不同模型家族之间的差异,我们提示了三个开源模型和一个闭源模型(LlaMA-3.3 70B Grattafiori et al. (2024) (https://arxiv.org/html/2609.02482#bib.bib19),Mistral 3.2 24B²,Gemma 3 27B Gemma Team (2025) (https://arxiv.org/html/2609.02482#bib.bib18),以及GPT 4.1 (gpt-4.1-2025-04-14)³。⁴ 为简洁起见,我们随后将这些模型分别称为LlaMA 3.3、Mistral 3.2、Gemma 3和GPT 4.1。模型选择参考了先前对创意写作性能的评估。Paech (2023) (https://arxiv.org/html/2609.02482#bib.bib37)。其他模型经过试用但因反复出现的生成故障(包括截断、重复和意外的语言切换)而被排除。⁵ 被排除的模型:Mixtral, LlaMA-3-8B, QwQ-32B, Qwen-2.5, Apertus。我们为所有模型采样时将温度(temperature)和核采样(top-p)参数均设为1,以研究不受采样参数影响的模型行为,使结果具有跨模型可比性。为确保可重复性,我们使用了带有固定种子的随机函数。
表1:英语(en)和德语(de)文本的平均句子长度(以单词计)。匹配的人工创作摘录英语平均10761字,德语平均7953字。生成文本的故事长度在附录I (https://arxiv.org/html/2609.02482#A9)中报告。
由于长篇生成对许多模型,特别是开源模型来说仍然具有挑战性,我们采用了迭代式的、基于章节的提示策略。我们不是发出单一提示,而是逐步引导生成,每一章都基于模型先前的输出进行条件化。如表2 (https://arxiv.org/html/2609.02482#S3.T2)所示,模型被分配一个系统角色,并获得用于生成叙事章节的逐步用户指令。通过迭代测试优化了提示,以抑制元评论、面向用户的对话、重复和过早结束。由此产生的数据集,一个包含8000个AI生成故事(每个模型每种语言1000个)的语料库,可在我们的代码库中获取,连同匹配的人工创作样本的元数据和开头句子。⁶ 本项目使用的代码和数据可在此处找到:https://github.com/BjoernNieth/worldbuilding-AI。数据集详情在表1 (https://arxiv.org/html/2609.02482#S3.T1)中报告。我们报告了四项稳健性检查。为排除记忆化因素,我们测量了生成文本与其源书之间的13-gram重叠度。为确认对提示表述的稳健性,我们为每个开源模型和语言运行了三个提示变体,这些变体在措辞上...

相似文章

大型语言模型总是讲相同的故事吗?

arXiv cs.CL

本文研究大型语言模型是否能够生成多样化的故事。通过叙事相似性分析,作者发现,LLM生成的叙事彼此之间的相似度始终高于人类撰写的故事,而常见的缓解策略(如负面提示和温度缩放)未能解决这种同质化问题。