从角色到情节:基于角色的多智能体长篇叙事故事生成
摘要
介绍了Magnet——一个基于角色的多智能体目标驱动叙事引擎,用于长篇故事生成,以及Atlas——一个基于图的流水线,用于检测生成叙事中的幻觉。该框架相比单模型基线和IBSEN提高了连贯性并减少了幻觉。
arXiv:2607.00918v1 公告类型:新发布
摘要:尽管大型语言模型(LLM)在创意小说生成方面表现令人印象深刻,但它们在长篇故事中难以维持叙事一致性和连贯的情节脉络。在这项工作中,我们引入了一个用于长篇叙事生成和验证的统一框架。MAGNET是一个用于讲故事的、基于角色的多智能体目标驱动叙事引擎,通过基于共享世界状态和不断演变的故事目标提出行动的角色代理来生成故事;而ATLAS是一个基于图的流水线,用于比较生成故事中场景级别的世界表征以检测幻觉。通过使用LLM编辑器、配对评分标准以及ATLAS评估MAGNET,我们展示了我们的框架相比单模型提示和IBSEN能生成更连贯的叙事。在100页篇幅下,与单模型基线相比,MAGNET将注释和幻觉分别减少了41%和50%,与IBSEN相比分别减少了34%和45%,配对评分评估也显示出类似结果。这些结果表明,长篇叙事可以源自显式的世界状态追踪和目标驱动的多智能体生成,为可控且结构连贯的长篇叙事生成奠定了基础。
查看缓存全文
缓存时间: 2026/07/02 05:39
# 基于角色接地多智能体故事生成的长篇叙事 来源:https://arxiv.org/html/2607.00918 Aayush Aluru, Chloe Ho11footnotemark:1, Muhammad Hammouri, Kerry Luo, Myra Malik, Ryan Lagasse, Arjun Bahuguna55footnotemark:5, Vasu Sharma55footnotemark:5 Pocket FM aayush\.aluru09@gmail\.com, ch4941@princeton\.edu, hammouri@umich\.edu, kerryluo1@gmail\.com, arjunbahuguna251@gmail\.com *贡献相等。* *普林斯顿大学。* *密歇根大学。 *马里兰大学。 *资深作者。 *庞培法布拉大学。 ###### 摘要 尽管大语言模型(LLMs)在创意虚构类文本生成方面展现了令人印象深刻的能力,但在长篇故事中维护叙事一致性和连贯的情节线索仍存在困难。本文提出一个统一框架,用于长篇叙事生成与验证。**Magnet** 是一个基于多智能体、以目标为驱动的叙事引擎,通过角色接地智能体,依据共享的世界状态和不断演进的故事目标生成动作;**Atlas** 则是一个基于图的流水线,通过比较生成故事中各场景级别的世界表示来检测幻觉。通过使用LLM编辑、成对评分标准以及 Atlas 对 Magnet 进行评估,我们的框架与单模型提示和 IBSEN 相比,能产生更连贯的叙事。在 100 页长度上,Magnet 相比单模型基线减少了 41% 的注释和 50% 的幻觉,相比 IBSEN 分别减少了 34% 和 45%,成对评分评估也显示了类似结果。这些结果表明,长篇叙事可以通过显式的世界状态追踪和目标驱动的多智能体生成涌现出来,为可控且结构连贯的长篇叙事生成提供了基础。 ## 1 引言 大语言模型(LLMs)极大地推动了开放式文本生成的发展,使其可用于创建角色人设和模拟复杂交互(Wang 等人,2024b(https://arxiv.org/html/2607.00918#bib.bib6);OpenAI,2024(https://arxiv.org/html/2607.00918#bib.bib5))。尽管 LLMs 展现了强大的叙事生成能力,但它们存在角色不一致和情节不连贯的问题,限制了生成高质量长篇叙事的能力(Lu 等人,2026(https://arxiv.org/html/2607.00918#bib.bib3);Shao 等人,2023(https://arxiv.org/html/2607.00918#bib.bib4);Yao 等人,2019(https://arxiv.org/html/2607.00918#bib.bib2))。在多角色环境中,这些问题变得尤为突出,LLMs 难以在复杂的角色关系和交互中平衡叙事目标与角色动作(Park 等人,2023(https://arxiv.org/html/2607.00918#bib.bib8);Gao 等人,2024(https://arxiv.org/html/2607.00918#bib.bib7);Li 等人,2026a(https://arxiv.org/html/2607.00918#bib.bib9))。近期工作,包括 StoryVerse(Wang 等人,2024a(https://arxiv.org/html/2607.00918#bib.bib10))、Agents' Room(Huot 等人,2025(https://arxiv.org/html/2607.00918#bib.bib11))和 IBSEN(Han 等人,2024(https://arxiv.org/html/2607.00918#bib.bib26)),探索了多智能体系统在叙事生成中的应用,但它们仍依赖文本记忆,限制了生成连贯故事的能力(Lewis 等人,2021(https://arxiv.org/html/2607.00918#bib.bib14);Shinn 等人,2023(https://arxiv.org/html/2607.00918#bib.bib15);Liu 等人,2026(https://arxiv.org/html/2607.00918#bib.bib12);Teleki 等人,2025(https://arxiv.org/html/2607.00918#bib.bib13))。除了创造性内容生成之外,仍需要对此类内容进行彻底评估。现有工作已在长篇叙事理解和事实性方面取得进展(Kočiský 等人,2018(https://arxiv.org/html/2607.00918#bib.bib41);Kim 等人,2023(https://arxiv.org/html/2607.00918#bib.bib42);Sansford 等人,2024(https://arxiv.org/html/2607.00918#bib.bib43);Lyu 等人,2025(https://arxiv.org/html/2607.00918#bib.bib44);Hamilton 等人,2025(https://arxiv.org/html/2607.00918#bib.bib45);Li 等人,2026a(https://arxiv.org/html/2607.00918#bib.bib9);Wu 等人,2025(https://arxiv.org/html/2607.00918#bib.bib36);Que 等人,2024(https://arxiv.org/html/2607.00918#bib.bib60))。然而,这些方法并未提供一个用于识别长篇生成叙事中幻觉的框架。本文中,我们引入 **Magnet**,一个用于生成连贯长篇叙事的多智能体故事生成系统,以及 **Atlas**,一个基于图的幻觉评估流水线,通过将当前场景的世界状态表示与先前场景进行比较来识别不一致(Tian 等人,2026(https://arxiv.org/html/2607.00918#bib.bib35))。我们的工作旨在回答以下研究问题:**当自主智能体通过共享的世界状态进行交互时,长篇叙事能否从角色人设与更新目标状态的交互中涌现?** 通过层级化编辑评估、成对评分分析和 Atlas,我们表明 Magnet 改进了叙事连贯性,为未来的长篇叙事生成工作奠定了基础。我们的主要贡献包括:1)**Magnet**,一个多智能体“动作-评价-叙述”生成框架,包含角色接地动作生成、评价修正、叙述者驱动的散文写作、共享世界状态以及用于远程连贯的演进故事目标;2)**Atlas**,一个基于图的评估流水线,用于检测长篇故事中的幻觉,为模型失败提供可解释的信号;3)**经验评估指标**,表明 Magnet 减少了编辑评论数量,提高了成对评分分数,并减少了长篇故事中的幻觉。 ## 2 相关工作 **多智能体叙事生成** 近期研究表明,将叙事生成分解为交互的语言模型智能体,每个智能体负责一个高层级角色(如规划、角色发展或场景写作),可以提高长篇叙事连贯性(Xia 等人,2025(https://arxiv.org/html/2607.00918#bib.bib25);Huot 等人,2025(https://arxiv.org/html/2607.00918#bib.bib11))。此外,IBSEN(Han 等人,2024(https://arxiv.org/html/2607.00918#bib.bib26))和 StoryVerse(Wang 等人,2024a(https://arxiv.org/html/2607.00918#bib.bib10))等框架引入了“导演-演员”架构,其中规划模块引导角色智能体完成结构化的叙事目标,表明将全局叙事规划与局部角色行为分离可以实现一致性和可控性(Wu 等人,2023(https://arxiv.org/html/2607.00918#bib.bib29);Borawski 等人,2026(https://arxiv.org/html/2607.00918#bib.bib28))。然而,这些系统仍严重依赖于提示层面的协调,叙事状态以文本形式维护,而非通过持久的共享表示进行跟踪(Packer 等人,2024(https://arxiv.org/html/2607.00918#bib.bib27))。 **结构化状态跟踪** 长篇叙事生成中的一个关键挑战是随时间维持一致性,尤其是在多角色环境中(Xia 等人,2025(https://arxiv.org/html/2607.00918#bib.bib25))。结构化生成方面的先前工作探索了使用显式状态表示来提高基于文本环境的一致性(Huang 等人,2026(https://arxiv.org/html/2607.00918#bib.bib33);Li 等人,2026b(https://arxiv.org/html/2607.00918#bib.bib32))。例如,关于向交互智能体注入常识知识的工作表明,世界状态的结构化表示可以改进决策任务中的动作预测和叙事连贯性(Chi 等人,2025(https://arxiv.org/html/2607.00918#bib.bib30);Ding 等人,2025(https://arxiv.org/html/2607.00918#bib.bib31);Chen 等人,2024(https://arxiv.org/html/2607.00918#bib.bib59))。我们的工作在此基础上,引入世界状态表示,使叙事事实、角色状态以及顺序更新的目标能够在场景间演进,而无需外部监督。 **故事评估** 近期研究表明,LLM-as-a-Judge 方法与人类偏好高度相关(Zheng 等人,2023(https://arxiv.org/html/2607.00918#bib.bib51);Liu 等人,2023(https://arxiv.org/html/2607.00918#bib.bib52);Gu 等人,2025(https://arxiv.org/html/2607.00918#bib.bib57);Wang 等人,2025(https://arxiv.org/html/2607.00918#bib.bib55);Kim 等人,2024(https://arxiv.org/html/2607.00918#bib.bib56))。在这些方法中,成对和基于评分标准的比较能够提高主观任务中与人类判断的一致性和一致性(Wang 等人,2026(https://arxiv.org/html/2607.00918#bib.bib53);Rao 和 Callison-Burch,2026(https://arxiv.org/html/2607.00918#bib.bib54);Liu 等人,2025(https://arxiv.org/html/2607.00918#bib.bib58);Que 等人,2024(https://arxiv.org/html/2607.00918#bib.bib60))。此外,评估长篇叙事的一致性需要追踪复杂的世界状态,因此基于图的验证是一种有效方法(Guan 等人,2021(https://arxiv.org/html/2607.00918#bib.bib46);Chhun 等人,2022(https://arxiv.org/html/2607.00918#bib.bib47);Chen 等人,2022(https://arxiv.org/html/2607.00918#bib.bib48);Kim 等人,2023(https://arxiv.org/html/2607.00918#bib.bib42);Sansford 等人,2024(https://arxiv.org/html/2607.00918#bib.bib43))。诸如 STAGE(Tian 等人,2026(https://arxiv.org/html/2607.00918#bib.bib35))的基准强调了在评估叙事理解与生成时,显式表示实体、事件和关系的重要性。虽然 HaluEval(Li 等人,2023(https://arxiv.org/html/2607.00918#bib.bib62))和 HalluLens(Bang 等人,2025(https://arxiv.org/html/2607.00918#bib.bib61))等幻觉基准关注与外部知识相关的错误,HelloEval(Que 等人,2024(https://arxiv.org/html/2607.00918#bib.bib60))评估生成文本的质量,但当前方法并未探索识别生成文本内部的不一致性(Lyu 等人,2025(https://arxiv.org/html/2607.00918#bib.bib44))。 ## 3 方法 参见图1:Magnet 的生成流水线。 ### 3.1 目标序列化 每个故事以一个高层次目标为起点,该目标为叙事发展提供方向。当目标完成时,Opus 4.7(Anthropic,2026a(https://arxiv.org/html/2607.00918#bib.bib20))目标生成器会生成一个后续目标。经验上,我们观察到大约 15 个时间步后,角色动作会变得越来越重复。为避免叙事停滞,我们的框架会在目标超过 15 个时间步未完成时替换该目标。大约 40 步后,连续目标也开始重复类似的故事情节。为保持叙事多样性,系统每 40 步生成一个目标,将故事方向转向一个新领域。这些较大的转换旨在引入新的冲突,同时前一个目标结束。 ### 3.2 故事生成 每个角色由一个角色人设定义,包含属性如关系、个性、目标、角色描述、角色、位置和能力。在每个时间步,角色智能体接收角色人设、当前故事目标、近期故事历史以及与该角色相关的先前世界变量,并使用 DPO-tuned Gemma-4-31B-it 模型(Google,2026(https://arxiv.org/html/2607.00918#bib.bib22))生成一个动作,描述该角色接下来打算做什么。动作生成后,Gemini 2.5 Flash(DeepMind,2025(https://arxiv.org/html/2607.00918#bib.bib19))LLM 评论器被要求评估所提议动作的质量。评论器会收到该动作、角色人设、当前故事目标和当前世界状态,并被指示判断该动作是否相关、具体、与角色和当前场景一致。如果动作未能有效推进故事目标、模糊不清、不符合角色设定、不可信或重复,评论器会提供反馈,以便角色智能体生成另一个动作。如果动作被接受,评论器会生成与提议动作相关的世界状态更新。所有角色都生成了动作后,Opus 4.7(Anthropic,2026a(https://arxiv.org/html/2607.00918#bib.bib20))叙述者产生故事的下一段落。叙述者接收提议的动作、当前世界状态、当前故事目标和先前故事段落,然后有选择地挑选最适合当前场景的动作,并利用所选动作创作连贯的故事散文。如果叙述者选择了一个评论器认为已完成前一个目标的动作,Opus 4.7(Anthropic,2026a(https://arxiv.org/html/2607.00918#bib.bib20))目标生成器将生成一个新目标。生成新目标时,模型接收前一个目标、最近的故事段落、当前世界状态、所有角色人设以及所有先前目标。在此上下文中,目标生成器被指示生成一个相关的、不重复的、能让故事进一步发展的具体目标。除了生成下一个目标,模型还会生成一个过渡段落,将前一个故事段落桥接到新目标。该过渡以故事散文而非世界更新或摘要文本的形式编写,并包含在最终故事中。 **算法 1** 单时间步的故事生成 1: 世界状态 W,目标 g,角色 C,停滞计数 k,时间步 t,近期故事段落 s 2: **动作生成与评论修正** 4: **repeat** 5: a ← CharacterAgent(c, g, W_c, s) 6: r ← Critic(a, c, g, W) 7: **until** r.revise = False 或 MAX_REVISIONS 8: actions[c] ← (a, r.world_updates, r.goal_reached) 9: **end for** 10: **叙述者** 11: selected ← Narrator(actions, g, W, s) 12: 将 selected.paragraph 追加至故事 13: **世界状态提交** 14: goal_reached ← False 15: **for all** c ∈ selected.order **do** 16: **for all** (key, val) ∈ actions[c].world_updates **do** 17: W[key] ← val 18: **end for** 19: **if** actions[c].goal_reached **then** 20: goal_reached ← True 21: **end if** 22: **end for** 23: **目标序列化** 24: **if** t mod 40 = 0 **then** 25: g ← GoalGenerator(W, g, domain_shift=True) 27: **else if** k ≥ 15 **then** 28: g ← GoalGenerator(W, g, status="stalled") 30: **else if** goal_reached **then** 31: g ← GoalGenerator(W, g, status="complete") 33: **else** 35: **end if** ### 3.3 世界状态 我们将故事状态表示为一个有向图,包含一个根世界节点、角色节点、状态变量节点,以及表示节点间关系的边。状态变量节点被展平成字典表示,在生成时提供给智能体。为了更新世界状态,我们会应用所选动作的世界状态更新。
相似文章
AutoPersonas:一个用于开放式人格进化的多时间尺度循环引擎
本文介绍了AutoPersonas,一种用于长期人格智能体的架构,通过将发散与证据驱动的吸收分离来防止“自锁”,在模拟环境中展示了更低的重复性和更好的身份连续性。
迈向人类级别的书籍写作能力
本文介绍了一个数据集和训练框架,将人类创作的小说转换为多分辨率规划支架,使长上下文语言模型能够生成具有更类似人类散文和叙事动力的书籍规模小说。
MAG:用于多模态动作和指南生成的Web-Agent基准与框架
MAG引入了一个用于多模态Web代理的基准和框架,这些代理既执行任务又生成逐步指南文本,使用截图和接地方案。该工作包括一种GRPO训练方法,几乎将9B代理的成功率提高了一倍。
EpiNarrate: 基于智能体的流行病学情景预测有依据叙述生成
介绍了EpiNarrate,一个将结构化数值推理与自然语言生成分离的智能体框架,用于从集成预测中生成有依据的流行病学叙述。
PersonaArena:用于评估和增强大语言模型中人格层面角色扮演的动态模拟框架
PersonaArena 是一个动态模拟框架,利用大规模社交内容语料库和多智能体辩论评判机制,评估并提升大语言模型在真实社交场景中保持连贯且真实的人格层面角色扮演能力。