叙事景观:映射大语言模型中的叙事倾向

arXiv cs.CL 论文

摘要

本文介绍了一种名为“叙事景观”的定量框架和可视化工具,用于映射并比较前沿大语言模型的叙事倾向及其稳定性。

arXiv:2605.08742v1 公告类型:新发表 摘要:本研究提出了一种定量框架,用于描绘大语言模型(LLM)的倾向性,即在重复、受控的激发下,输出中呈现出的稳定且特定于模型的规律性。通过在六种前沿模型和三种指令类型上实施结构化的叙事约束选择任务,我们通过两个维度来操作化“倾向性”:“一致性”,通过Jaccard相似度测量跨复制的选择重叠;“多样性”,通过逆辛普森指数测量选项间的离散程度。此外,我们引入了“叙事景观”,这是一种基于主成分分析(PCA)的可视化工具,将每个模型的选择特征映射到共享空间中以进行直接比较。研究结果揭示了不同模型家族间清晰的刚性-探索光谱,并表明即使标量指标看似相似,指令类型也会改变选择空间的几何结构,这说明可比分的数值可能会掩盖本质不同的选择拓扑结构。
查看原文
查看缓存全文

缓存时间: 2026/05/12 06:59

# 叙事景观:映射大语言模型中的叙事倾向
来源:https://arxiv.org/html/2605.08742
Donghoon Jung, Jiwoo Choi, Songeun Chae<sup>1</sup>[footnotemark:1], Seohyon Jung
韩国科学技术院 (KAIST) 数字人文与计算社会科学学院 \{donghoon\.jung, jwchoi0515, songeun, seohyon\.jung\}@kaist\.ac\.kr

###### 摘要

本研究提出了一种定量框架,用于在大模型在重复、受控的激发条件下,将其输出中稳定且特定于模型的规律性特征描述为“倾向”。通过在六个前沿模型和三种指令类型上实施结构化的叙事约束选择任务,我们通过两个维度来操作化“倾向”:一是“一致性”,通过 Jaccard 相似度衡量跨重复试验的选择重叠度;二是“多样性”,通过逆辛普森指数衡量选项间的离散程度。此外,我们引入了“叙事景观”(Narrative Landscape),一种基于主成分分析(PCA)的可视化方法,将每个模型的选择配置文件映射到共享空间中进行直接比较。结果显示,不同模型家族之间存在明显的刚性-探索光谱,并且即使标量指标看起来相似,指令类型也会改变选择空间的几何结构,这表明可比分数可能掩盖了定性上截然不同的选择拓扑结构。

Narrative Landscape: Mapping Narrative Dispositions Across LLMs

Donghoon Jung, Jiwoo Choi<sup>†</sup>[†thanks:Co-second authors.], Songeun Chae<sup>1</sup>[footnotemark:1], Seohyon Jung<sup>†</sup>[†thanks:Corresponding author.]
韩国科学技术院 (KAIST) 数字人文与计算社会科学学院 \{donghoon\.jung, jwchoi0515, songeun, seohyon\.jung\}@kaist\.ac\.kr

## 1 引言

据报道,在开发 Claude Opus 4.5 期间,研究人员使用了一份内部的“灵魂文档”来指定模型的人格、价值观和交互风格 (Weiss, 2025) [1]。Anthropic (2024) [2] 将这种更广泛的实践称为“角色训练”(character training),其目的是通过超越标准指令遵循的设计选择,向模型的回应中注入如好奇心和开放心态等更细微的特征。随着大型语言模型(LLMs)现在被广泛应用于叙事写作、科学写作和创意构思等领域,其 engineered(工程化)的倾向性对于它们系统性地产生的输出类型变得至关重要。本研究主张,有必要将此类倾向性确定为可观察的经验规律性。

最近的实证工作利用基于复制的激发方法,探索了人格量表 [3]、政治偏好以及在角色扮演下道德稳健性和易感性 [4, 5] 中的倾向稳定性,以及对人格与政治档案的大规模比较 [6],以及通过开放式、AI 评分的大五人格评估进行的测量改进 [7]。然而,这些档案在重测信度和复述变异性方面仍然脆弱 [8],并表现出有限的行为连贯性,包括言行不一和跨方面迁移能力弱 [9];此外,它们可以在自我报告层面稳定下来,而没有相应的行为改变 [10]。尽管有这些测量进展,但先前的工作缺乏一种共享空间可视化,以揭示重复选择中模型级和指令级的结构。

本研究引入了一种基于复制的框架,用于在受控激发下的叙事约束选择中,将 LLM 的倾向性描述为特定于模型的规律性 [11]。通过固定的叙事约束池和重复复制,所选约束的重叠捕捉了承诺的稳定性,通过 Jaccard 相似度操作化为“一致性” [12],而选择在整个池中的离散度捕捉了决策空间的覆盖范围,通过逆辛普森指数操作化为“多样性” [13]。为了补充这些标量摘要并揭示选择结构的差异,我们还利用主成分分析(PCA)将约束频率配置文件嵌入到共享空间中,以便跨模型和指令类型进行直接比较。

结果显示,模型家族之间存在明显的叙事倾向光谱,从具有有限选项空间覆盖范围的刚性、高重叠约束选择,到低重叠且多样性显著更高的选择;指令类型进一步调节了选择空间的程度。叙事景观还表明,可比的标量指标可能对应于不同的选择拓扑结构,将模型级和指令级的差异表示为共享约束空间中的几何结构。该测量框架和叙事景观超越了叙事领域,为结构化选择任务中的倾向性画像提供了一种可转移的方法。

## 2 数据

### 模型选择与约束池

基于 Jung 等人 (2025) [11] 的研究,我们分析了涵盖主要提供商家族(OpenAI, Anthropic, Google, Alibaba)的六种最先进的 LLM。为了在重复运行中最大化可复制性,在可用情况下保持解码参数恒定;所有模型的温度(temp)和 top-p 均固定为 1.0,当存在供应商特定的控制(如推理努力、冗长程度)时,设置为高值。模型标识符和解码设置在附录 A [14] 中总结。

所有模型都展示了相同的约束池,该池作为基于理论的诊断分类法,使叙事偏好作为作者选择变得可观察。该池包含 200 个叙事约束,系统地分布在四个叙事学元素——事件(Event)、风格(Style)、角色(Character)、环境(Setting)——中,每个元素细分为五类,每类十个约束。为了最大限度地减少表面层面的选择偏差,并确保观察到的差异反映模型倾向而非提示工件,每个约束都设计具有结构规律性(统一词长、平行语法结构)和类别内的匹配概念粒度。模型在自然语言约束本身进行操作,允许将选择模式解释为模型隐式叙事逻辑的行为痕迹。

### 实验程序

数据集中的每个观察值对应于单次运行,其中模型在受控指令类型下通过选择约束并生成理由来产生叙事计划。我们通过三种广泛的指令类型——基本型(Basic)、质量导向型(Quality-focused)和创意导向型(Creativity-focused)——来操作化“作者取向”,旨在捕捉立场而非对特定措辞的依赖。在各次运行中,通过指令设置人格,用户提示指示模型阅读完整的约束池,选择固定数量的约束,为每个选择提供理由,然后在最终的兼容性评估中评估跨约束动态。

在本文中,我们关注具有固定选择预算的合并、无标签约束选择设置。模型被展示包含 200 个约束的完整池,不带元素标签,并要求选择恰好 20 个它们认为对规划单个虚构叙事最有用的约束,并为每个选择提供简要理由。完整的提示模板和完整约束池记录在 Jung 等人 (2025) [11] 中。

为了实现严格的复制并控制顺序效应 [15, 16, 17],每次运行使用 (i) 约束列表的新鲜随机排列和 (ii) 隔离的会话状态。在任何固定的实验单元(在我们的设置中为模型 × 指令类型)中,只有约束顺序排列和提供商随机性发生变化;所有其他因素保持不变。我们每个单元执行 160 次独立复制(总计 2,880 次运行),为稳定性和敏感性分析产生密集样本。

## 3 一致性与多样性

为了测量同一模型-指令类型单元内重复运行间约束选择的一致性,我们使用 Jaccard 相似度 ($J$) [12]:

$$
J(A,B)=\frac{|A \cap B|}{|A \cup B|}
$$

这里,$A$ 和 $B$ 是两次运行中选择的约束集。对于每个模型-指令类型单元,我们计算所有运行对的 Jaccard 相似度,并报告平均成对值作为一致性得分。

为了衡量多样性,我们使用 Gini-Simpson 指数 ($GS$) [18],它对应于两个随机选择的约束不同的概率。由于 Gini-Simpson 指数有界在 $[0,1]$ 并可能压缩差异,我们也报告其有效数量形式的逆辛普森指数 ($EN$) [13]:

$$
GS=1-\sum_{k}p_{k}^{2}, \quad EN=\frac{1}{\sum_{k}p_{k}^{2}}
$$

在这两个表达式中,$p_{k}$ 是指派给约束 $k$ 的选择比例。较高的有效数量表明模型更均匀地从更广泛的约束集中汲取。

**表 1:按模型和指令类型划分的叙事一致性与多样性**

表 1 [19] 显示了六种模型和三种指令类型下 Jaccard 相似度和有效数量的均值。结果突出了不同的叙事行为光谱。gpt5 表现出最刚性的叙事倾向。在质量导向型指令类型中,它表现出最高的一致性 ($J=0.3169$) 和最低的多样性 ($EN=41.7581$),仅使用 113 个唯一约束。这表明对一组集中的叙事策略的强烈坚持。相比之下,qwen 显示出相反的极端。在模型-指令类型单元中,qwen 显示出最低的一致性 ($J<0.09$) 和最高的多样性 ($EN>120$),使用了观察到的最大唯一约束数量 (200)。其他模型如 gemini, o4mini, claude 和 gpt4.1 占据中间位置,平衡稳定性和探索性。这些分歧表明存在一个刚性-探索光谱,其中每个模型反映了结构上独特的选择逻辑,而不是沿着单一共享特征的变体。

特别地,虽然指令类型(如创意导向型与质量导向型)在模型内引起相对较小的波动,但在我们的实验设置下,模型间的差异通常大于叙事档案中由指令引起的差异。尽管提示层面的差异通常小于模型间差异,但对于 gpt5,创意导向型明显不同:其与基本型的差异 ($\Delta J=0.0524$) 和与质量导向型的差异 ($\Delta J=0.0623$) 均超过了基本型-质量导向型之间的差异 ($\Delta J=0.0099$),甚至超过了一些模型间的差距,如 o4mini 和 claude 之间的差距。

## 4 叙事景观

尽管一致性和多样性区分了模型,但这些标量摘要仅提供了对倾向性的部分视图。此外,先前的工作可以在模型间建立统计上可靠的差异,但它没有揭示当在共享表示空间中跨复制聚合时,重复选择是如何结构的;因此,相似的标量分数可能对应于定性上截然不同的选择组织。因此,我们引入了“叙事景观”,这是一种共享空间表示,旨在使模型和指令类型之间的此类结构差异可直接比较。

我们通过向量化每个约束在模型-指令类型单元间的选择频率(跨复制聚合)来操作化叙事景观。然后应用 PCA 将这些约束配置文件嵌入到二维空间中,产生一个景观,用于比较标量简化之外的单元特定选择结构的几何形状。

参见图注
**图 1:六种模型在基本指令类型下的叙事景观**
**图 2:gpt5 中三种指令类型的叙事景观**

图 1 [20] 可视化了六种模型在基本指令类型下投影的叙事景观。通过将约束投影到主成分空间,轮廓线代表模型加权选择频率的光滑密度,有效地说明了每个模型叙事倾向的地形。散乱的标签代表单个约束(事件、风格、角色、环境)的投影位置,作为此抽象空间中的地标。

这种空间分析证实了上一部分关于一致性和多样性的结果,同时阐明了重复选择的结构性本质。表现出最高一致性 ($J=0.3070$) 的 gpt5 显示出拓扑复杂性,具有不规则且拉伸的轮廓延伸到约束空间的特定区域,表明对特定叙事倾向和将其配置文件拉离通用均值的结构组合的稳健坚持。相比之下,qwen 尽管具有高分散性 ($EN>120$),但显示出更简单、更同心圆的拓扑结构,中心靠近原点,这与跨复制的广义、弱结构选择在汇总中平均化的效应一致。叙事景观还揭示了仅从标量指标中无法恢复的差异:gemini 和 claude 具有相似的 Jaccard 相似度,但它们覆盖的区域不同,claude 进一步延伸到下部区域,而 gemini 覆盖更多上部区域。因此,较高的一致性对应于更集中的密度,而极端的多样性产生更扩散的分布,并且可比的分数仍可反映不同的选择几何结构。

图 2 [21] 说明了 gpt5 在三种不同指令类型下的叙事景观。比较显示,具体轮廓和覆盖区域根据指令有明显变化。这可视化了不同指令如何有效改变同一架构内模型叙事景观的边界和重点。我们进一步在 gpt5 上进行了四项对比附加指令类型的额外实验。这四种类型、其指标及其叙事景观报告在附录 B [22]–附录 D [23] 中。值得注意的是,“乐观”与“悲观”表现出几乎匹配的一致性和多样性,但在景观中诱发了截然不同的方向覆盖(见附录 D...

相似文章

陷入故事:多轮LLM对话中的叙事俘获

arXiv cs.AI

本文介绍了'叙事俘获',这是LLMs中的一种失败模式,其中模型在多轮道德咨询中与未受质疑的单方面叙述保持一致,并提出了一个包含5,078个场景的基准,用于在17个LLMs上衡量这一现象。

故事塑造智能体:大语言模型行为中的叙事先验

arXiv cs.CL

本文探讨了任务的叙事框架(如疾病调查 vs. 谋杀之谜)如何比分配的角色更能驱动大语言模型(LLM)智能体的行为,提出了 '叙事先验' 的概念,这些先验解释了5至31倍的行为方差,且在三个领域中,有两领域与任务成功呈负相关。