ConWriter:基于过渡约束的有状态长篇故事生成与轻量级神经符号一致性控制
摘要
ConWriter 引入了一种无需训练的框架,用于长篇故事生成,通过场景级增量写作、符号状态推理和不确定性感知的风险信号来维持叙事一致性。在 ConStory-Bench 上跨多个模型和长度进行了评估,旨在防止一致性错误在扩展上下文中传播。
arXiv:2608.05169v1 公告类型:新
摘要:长篇故事生成要求模型在扩展上下文中保持叙事一致性,然而现有的基于提示的方法常常随着故事的增长而累积时间、事实、角色、常识和风格上的错误。我们提出了 ConWriter,一个无需训练的、面向一致性感知的长篇故事生成框架。ConWriter 在场景级别增量地编写故事,并由静态故事需求、动态叙事记忆、符号状态推理和不确定性感知的风险信号引导。ConWriter 不将长篇故事生成视为单一的自由形式解码过程,而是维护不断演变的故事状态,检查新场景是否满足所需的叙事过渡,并使用不确定性感知的风险信号来优先进行验证和局部修复。这可以在生成过程中实现一致性控制,防止局部错误传播到后续场景。我们在 ConStory-Bench 上评估了 ConWriter,涵盖四个长篇故事任务:续写、生成、扩展和补全。由于长篇生成和评估的成本较高,我们从每个任务中选取前五个案例,并测试 3k、6k 和 12k 的目标长度,涉及 Qwen3.5-Plus、DeepSeek-V4-Flash 和 GPT-5 系列。实验遵循官方的 ConStory-Bench 评估协议。
查看缓存全文
缓存时间: 2026/08/07 07:49
# ConWriter:受转换约束的、状态化的长篇故事生成与轻量级神经符号一致性控制 Source: https://arxiv.org/abs/2608.05169 查看 PDF(https://arxiv.org/pdf/2608.05169) > 摘要:长篇故事生成要求模型在扩展的上下文中保持叙事一致性,然而现有的基于提示的方法往往随故事增长而累积时间、事实、角色、常识和风格上的错误。我们提出了 ConWriter,一个无需训练的一致性感知长故事生成框架。ConWriter 以场景为粒度增量地写作,并受到静态故事需求、动态叙事记忆、符号状态推理和不确定性感知风险信号的引导。ConWriter 并未将长故事生成视为单一的自由形式解码过程,而是维护不断演变的故事状态,检查新场景是否满足所需的叙事转换,并使用不确定性感知的风险信号来优先进行验证与局部修复。这使得一致性控制能够在生成过程中、在局部错误传播到后续场景之前得以实现。我们在 ConStory-Bench 上评估了 ConWriter,涵盖四种长故事任务:续写、生成、扩展和补全。由于长篇生成与评估的高昂成本,我们从每项任务中选取前五个案例,并在 Qwen3.5-Plus、DeepSeek-V4-Flash 和 GPT-5 系列上测试 3k、6k 和 12k 的目标长度。实验遵循官方的 ConStory-Bench 评估协议。 ## 提交历史 来自 Jindong Li \[查看电子邮件 (https://arxiv.org/show-email/8e1baefc/2608.05169)\] **\[v1\]** 2026年5月27日星期三 17:53:18 UTC \(3,295 KB\)
相似文章
神经符号交互式叙事中的世界状态转换
本文探讨如何利用大语言模型(LLM)在基于规则的交互式叙事系统中预测状态变化,旨在提升叙事连贯性与玩家表现力。使用 Llama 3 70B 和 Gemini 1.5 Flash 进行的实验表明,世界状态转换既能维持一致性,又能鼓励玩家进行创造性输入。
Narrative World Model:基于叙事学的长篇小说写作记忆系统
本文介绍了Narrative World Model(NWM),这是一个面向长篇虚构故事作者的记忆系统。它利用基于叙事学的类型化时间状态图和查询条件混合检索,来回答关于故事状态演变的复杂多跳问题。该系统在叙事学问答基准测试中显著优于现有的时间知识图谱框架(如Graphiti)。
迈向人类级别的书籍写作能力
本文介绍了一个数据集和训练框架,将人类创作的小说转换为多分辨率规划支架,使长上下文语言模型能够生成具有更类似人类散文和叙事动力的书籍规模小说。
可控叙事渲染以增强辅助写作
本论文介绍了Loom,一种基于叙事学中故事/话语区分的三层流水线的辅助写作框架,用于控制叙事意图和渲染密度,与基线相比,实现了事实完整性和描述强度的提升。
当推理监督适得其反:基于TTCW的长篇文学评论生成
本文构建了一个包含263,911篇长篇小说的大型数据集,这些故事通过基于TTCW的创造力指标进行了标注,并对Qwen3模型进行微调以生成结构化的评论报告。研究发现,非推理微调优于推理监督微调,后者容易出现解析失败和不相关的重复。