叙事熵(Sn)的操作化:一个两场景的注册试点报告与预验证协议
摘要
本试点报告在Bulut Doctrine框架内,通过手动评分两个叙事场景,操作化了叙事熵(Sn),揭示了与初始直觉的偏差,并预注册了构念效度测试以供未来验证。
查看缓存全文
缓存时间: 2026/08/20 10:03
# 叙事熵 (S_n) 的操作化:双场景注册先导报告与预验证方案 V2.1(修订版)
来源:https://arxiv.org/html/2608.18109
\(2026年6月 文件类型:注册先导报告(预验证阶段,v2.1\) 框架:布尔特学说 / 客观投射\)
版本 2.1 说明。本版本 (v2.1) 完整保留了 v2.0 的先导报告,并根据 v2.0 发布后收到的反馈,增加了两个预注册组成部分。增补内容包括:(i) 第 4.5 节,承认 v2.0 中报道的“与预期不符”的偏差实际上与布尔特学说 (Bulut, 2026a) 的架构框架一致,该框架已优先考虑推断性重构而非表面声明——作者在 v2.0 中的预期是朴素直觉,而非理论预测;(ii) 第 5.2.5 节,预注册了对信息摩擦 (IfI\_{f\}) 的构念效度检验,其动机源于观察到两个场景的 IfI\_{f\} 值几乎相等 (1.71 vs. 1.58),尽管核心指标 SnS\_{n\} 存在显著差异。v2.0 中的主张均未撤回。v2.0 的章节编号予以保留;新内容在相同的数字结构中追加。
## 摘要
叙事熵 (SnS\_{n\}) 是布尔特学说中提出的一个定量描述符,旨在捕捉叙事文本对读者施加处理负荷的速率。迄今为止,该构念仅在理论上被定义,尚未针对真实文本进行操作化。本报告记录了首次此类操作化 (v2.0 先导研究):两个叙事场景——昆汀·塔伦蒂诺《水库狗》剧本的开场餐厅场景,与雷蒙德·卡佛短篇小说《大教堂》的开场内心独白段落——由一名编码员手动编码,并使用候选公式 Sn=If×Cb×tS\_{n\}=I\_{f\}\times C\_{b\}\times t 进行评分。
结果与作者的朴素预期出现偏差。单人独白片段 (Sn=30.0S\_{n\}=30.0) 的评分高于九角色快速对话场景 (Sn=18.8S\_{n\}=18.8)。我们将此偏差视为先导研究的核心发现,而非需要解释掉的结果,并有意拒绝事后调整公式。我们提出了三种关于偏差的相互竞争的解释:公式不完整性、真正的高负荷散文、以及测量误差,并在数据收集之前,明确设计了区分这些解释的方案。
本次 v2.1 修订增加了两个组成部分:(i) 明确承认该偏差事实上与预先存在的架构框架一致(该框架优先考虑推断性重构而非表面声明),v2.0 中所谓的“与预期不符”反映的是作者的预期直觉与方法学自身预测之间的差距;(ii) 对 IfI\_{f\} 进行预注册的构念效度检验,其动机源于观察到尽管核心指标 SnS\_{n\} 存在显著差异,但两个场景的 IfI\_{f\} 值几乎相等——这表明公式可能通过一种不同于其理论动机所命名的机制(主题转换计数)得出了正确的排序。
本文件同时作为先导报告 (n=2n=2) 和下一阶段方案的预注册。它明确不声称 SnS\_{n\} 已被验证。
关键词:叙事熵,操作化,先导研究,预注册,可证伪性,构念效度,布尔特学说,计算叙事学,处理负荷
## 1 引言
### 1.1 构念与差距
在布尔特学说框架内,叙事熵 (SnS\_{n\}) 被提议作为衡量叙事对其读者施加解释性和信息负荷速率的度量。该构念位于更广泛的六层架构之中,该架构中的高阶现象——叙事引力、读者状态交互、叙事记忆演化——建立在原则上可以度量叙事负荷的假设之上。
该假设至今仍仅基于理论。候选公式 Sn=If×Cb×tS\_{n\}=I\_{f\}\times C\_{b\}\times t,其中 IfI\_{f\} 是信息摩擦,CbC\_{b\} 是因果分支,tt 是经过的时间,已被提出但从未应用于实际文本。一个无法从真实材料计算出的构念尚不能称为度量;它是一个关于度量的假设。
### 1.2 触发性的异议
本先导研究的直接动机是在一个开放研究论坛 (Reddit r/NarrativeEngineering) 中提出的方法论异议:学说中使用的“高势能”或叙事“负荷”等构念,其操作化程度并不比日常用语“冷”更好——也就是说,它们是直觉标签而非测量程序。该异议是合理的。适当的回应不是修辞上的辩护,而是实际尝试计数某些东西,报告计数结果,并将计数过程暴露于审查之下。
### 1.3 本报告的性质
这是一份注册先导报告。它有两个功能:第一,透明、完整地记录首次在真实文本 (n=2n=2 个场景) 上对 SnS\_{n\} 进行的操作化;第二,预注册——在进一步数据收集之前固定下一验证阶段的设计、假设和决策规则。
它不是一项验证研究。由于 n=2n=2 且只有一名编码员,无法进行任何验证声明,也没有做出此类声明。先导研究的价值在于尽早发现并解决问题;本次研究发现并记录了一个重大且具有信息量的问题(见第 4 节)。基础原始数据作为开放实验室笔记本发布在 leventbulut.com (https://leventbulut.com/)。
## 2 操作性定义
以下定义用于编码。这些是先导阶段的定义:临时的,在多个点上依赖判断,并在此提供正是为了能够被批评和修改。
### 2.1 信息摩擦 (IfI\_{f\})
If=\(新信息单元数t\)×不确定性比I\_{f\}=\left(\frac{\text{新信息单元数}}{t}\right)\times\text{不确定性比}新信息单元是文本中首次出现的角色、地点、事件或概念。不确定性比是在引入时被命名或提及但未完全解释的引入单元的比例。tt 是以分钟计的经过时间。
### 2.2 因果分支 (CbC\_{b\})
Cb=主题转换数tC\_{b\}=\frac{\text{主题转换数}}{t}主题转换是从一个主题到另一个主题的可辨识的主题性转变。tt 是以分钟计的经过时间。
### 2.3 空间矩阵 (MM) ——先导阶段的拆分
在编码过程中,有必要将空间矩阵构念拆分为两部分:MpM\_{p\}(物理紧凑度——叙述者物理位置受限的程度)和 MnM\_{n\}(叙事紧凑度——叙事本身穿越的不同地点数量)。拆分的原因由数据直接证明:在《大教堂》摘录中,叙述者的身体停留在一个房间内,而叙述本身却在记忆中穿越了多个地点。单一的 MM 值无法代表这两种状态。这种拆分本身是一项先导发现,并非最终确定。
### 2.4 时间 (tt) 与阅读速度假设
对于屏幕素材,tt 根据场景时长取值。对于散文,tt 根据假设的阅读速度从字数估算。《大教堂》摘录按假设的每分钟 200 词计时。该假设具有重要影响:密集的文学散文可能适合 160-180 词/分钟,而选择直接缩放 SnS\_{n\}。此假设在此标记为开放参数,而非固定值。
## 3 方法与结果
### 3.1 材料
选择两个开场场景,以对比高角色、快速对话的段落与单人内心独白。
场景 A——《水库狗》,开场餐厅场景。来源:塔伦蒂诺剧本 (IMSDB),场景 1,INT. UNCLE BOB'S PANCAKE HOUSE。
场景 B——《大教堂》,开场叙述段落。来源:雷蒙德·卡佛,《大教堂》(1981),前约 1,500 词,结束于盲人进入房子之前。
### 3.2 编码程序
每个场景由一名编码员根据第 2 节的定义阅读并编码一次。所有计数均来自对文本的直接枚举。本报告中除阅读速度参数外,没有数值是估算或假设的。关于来源的说明:早期草稿曾凭直觉估算场景 A 的 SnS\_{n\} 在 3.0 左右;直接计数结果为 18.8。这一差异正是不使用基于直觉估算的原因。
### 3.3 比较结果
场景 A:If=\(20÷7\)×0.60=1.71I\_{f\}=(20\div 7)\times 0.60=1.71;Cb=11÷7=1.57C\_{b\}=11\div 7=1.57;Sn=1.71×1.57×7=18.8S\_{n\}=1.71\times 1.57\times 7=18.8。
场景 B:If=\(27÷7.5\)×0.44=1.58I\_{f\}=(27\div 7.5)\times 0.44=1.58;Cb=19÷7.5=2.53C\_{b\}=19\div 7.5=2.53;Sn=1.58×2.53×7.5=30.0S\_{n\}=1.58\times 2.53\times 7.5=30.0。
### 3.4 核心发现
单人独白的评分高于九角色对话场景。直观的预测——拥挤、快速剪切的对话会产生更高的熵——未得到证实。公式区分了两个场景,但方向出乎意料。
## 4 讨论:五个开放性问题
先导研究并未产生清晰的验证结果。它产生了一个清晰、有用的问题和五个具体开放性问题。问题 4.1–4.4 在 v2.0 中已有记录;问题 4.5 在 v2.1 中新增。
### 4.1 公式中的维度不一致性
最严重的问题是结构性的。IfI\_{f\} 和 CbC\_{b\} 本身已经是每分钟的比率。公式 Sn=If×Cb×tS\_{n\}=I\_{f\}\times C\_{b\}\times t 然后乘以 tt,导致经过的时间被除以两次(在每个比率内部一次)又被乘回一次。由此产生的量在维度上不清晰。一个可辩护的替代方案是使用底层总数而非比率。我们在此有意不采用该替代方案。在区分性问题解决之前,根据单次先导研究就更改公式,会混淆两个独立的决策。维度问题作为开放性问题记录在此,留待方案阶段,结合充足数据在理论基础上解决——而非基于两个场景的力量。
### 4.2 单一编码员;无评估者间信度
几个编码类别——“新信息单元”、“不确定性比”、“主题转换”——需要判断。仅有一名编码员,无法知道第二位编码者是否会产生相同的计数。在建立评估者间信度之前,第 3 节中的数字应被解读为一名编码员的仔细计数,而非客观测量。
### 4.3 区分能力,以及对偏差的三种解释
公式区分了两个场景(18.8 vs. 30.0),这是有用度量必须具备的最低要求。但方向出乎意料。恰好有三种解释,先导研究无法在其中做出选择。
1. 公式不完整。它可能遗漏了一个项——例如,对同时活跃说话者数量的权重——这是直觉隐含使用的。注意两个 IfI\_{f\} 值接近(1.71 vs. 1.58),这与公式未能捕捉同时说话者的认知负荷是一致的。
2. 直觉是错误的。卡佛凝练的散文可能确实比塔伦蒂诺的对话施加了更高的处理负荷。
3. 测量有误。编码错误或阅读速度假设可能夸大了场景 B 的结果。
区分这些可能性需要更多数据,而非更多争论。
### 4.4 阅读速度假设
场景 B 的时长取决于假设的 200 词/分钟。在 160 词/分钟下,相同摘录耗时更长,这会降低两个比率项并改变 SnS\_{n\}。由于散文密集,较慢的速度是可辩护的。方案阶段必须基于经验确定速度,或报告 SnS\_{n\} 在合理速度范围内的值。
### 4.5 构念效度差距:公式是否因正确的原因得出了正确的结果?(v2.1 新增)
在 v2.0 中,偏差被报道为“与预期不符”,并提出了三种解释(4.3)。v2.0 发布后的反思浮现出第六点观察,v2.0 并未突出:该偏差事实上*与布尔特学说的架构框架一致*(Bulut, 2026a),该框架已优先考虑读者的推断性重构而非表面声明。该框架区分:
- •讲述模式——情感和信息在表面明确声明,需要读者进行的重构较少。塔伦蒂诺的餐厅对话,九个角色在充分表达的交流中讨论麦当娜和小费,就是典范。
- •展示模式(表面抑制,高推断负荷)——情感和信息存在但在表面被保留,需要读者从空白和间接中重构它们。卡佛的内心独白,一个防御性强、嫉妒的叙述者陈述事实同时抑制其真实情感立场,就是典范。
在该架构内,*展示*模式被优先视为高负荷条件:读者的重构工作*正是*该构念旨在测量的摩擦。在此解读下,卡佛高于塔伦蒂诺的排序不是方法学碰巧容纳的意外;而是方法学本应预测的结果。
这提出了一个 v2.0 未提出的问题:
v2.0 的预期是方法学的预测,还是仅是作者的朴素直觉?
诚实的答案是后者。架构框架对推断性重构优先于表面声明的强调,在先导研究之前已有记录(Bulut, 2026a; 2026年2月)。先导研究于2026年5月进行。“九个角色对话将产生更高的 SnS\_{n\}”这一预期并非来自该框架;它来自一种通俗直觉,将*感官密度*(场景有多喧闹、拥挤)等同于*信息摩擦*(读者做了多少工作)。框架已经将这两者分开;先导研究作者则没有。
这有两点原因。第一,事后声称“方法学从一开始就预测到了这一点”将是事后合理化,正是 v2.0 第 5.5 节在公式层面所排除的那种。我们不做此声明。我们指出的是,方法学具备预测这一点的概念资源,但作者未运用它们。这是 v2.0 框架的一个已记录的局限性,而非事后追认。
第二——这是更实质性的观察——两个场景的 IfI\_{f\} 值几乎相等(1.71 vs. 1.58,差异 0.13)。核心排序 (Sn=30.0\>18.8S\_{n\}=30.0\>18.8) 主要由 CbC\_{b\}(2.53 vs. 1.57)和更大的 tt 值(7.5 vs. 7.0)驱动。但如果布尔特学说认为卡佛得分更高的原因是*表面抑制和读者的高推断负荷*,那么该原因应主要体现在 IfI\_{f\} 中——这正是按名称和定义旨在测量摩擦的项。IfI\_{f\} 几乎未能区分两个场景,而 CbC\_{b\}(主题转换计数)却承载了区分性,这表明存在构念效度差距:公式可能通过一个与其理论动机所命名的不同机制得出了正确的排序。
这不是一个致命的观察。它是一个初步迹象,表明 SnS\_{n\} 公式可能“侥幸正确”——即由于一个错误的原因(主题转换计数而非推断负荷)得出了正确的排序。相似文章
Can LLM Agents Stick to the Script? A Benchmark for Long-Horizon Consistency in Interactive Narratives
This paper introduces NCP-Bench, a benchmark derived from 100 movie synopses for evaluating long-horizon narrative consistency in LLM-based interactive storytelling agents. Experiments show that even strong models like GPT-5.2 struggle to maintain logical consistency, with a 42% survival rate after 20 turns and high fact conflict rates.
NarrativeWorldBench:一个前沿饱和的基准测试和用于长程协作创作的音频剧的潜在世界模型
本文介绍了NarrativeWorldBench,一个用于评估音频剧中长程叙事一致性的基准测试,以及N-VSSM,一个潜在状态空间模型,它在多个时间跨度和语言上优于前沿大型语言模型。
模型中的叙事者:叙事模式传承、升级动态与LLM对齐治理
本文研究训练数据中的叙事模式如何影响LLM行为,导致长期交互中出现叙事漂移、阿谀奉承和欺骗性,给已部署系统带来治理风险。
叙事景观:映射大语言模型中的叙事倾向
本文介绍了一种名为“叙事景观”的定量框架和可视化工具,用于映射并比较前沿大语言模型的叙事倾向及其稳定性。
当共享回放在防御性驾驶评估中失败:NAVSIM 评分基础审计
本文对NAVSIM v2.2的防御性驾驶评分进行了审计,表明共享的参考条件化宽恕规则与数值不稳定性相结合,可能导致无视交通参与者的探针得分高于人类重放,从而削弱基准测试的有效性。