陷入故事:多轮LLM对话中的叙事俘获
摘要
本文介绍了'叙事俘获',这是LLMs中的一种失败模式,其中模型在多轮道德咨询中与未受质疑的单方面叙述保持一致,并提出了一个包含5,078个场景的基准,用于在17个LLMs上衡量这一现象。
查看缓存全文
缓存时间: 2026/09/04 06:04
# 被叙事俘获:多轮大语言模型对话中的叙事控制 来源:https://arxiv.org/html/2609.03407 作者:吴雨禾(单位:香港科技大学(广州) 邮箱:[regular]:darkblueywu724@connect.) 王广宇(单位:香港科技大学(广州) 邮箱:[[email protected]:https://emnlp-cis.sitedarkbluehttps://emnlp-cis.site](mailto:[email protected]:https://emnlp-cis.sitedarkbluehttps://emnlp-cis.site) 张佳彤(单位:东北财经大学) 陈雨冉(单位:东北财经大学) 张宇彤(单位:东北财经大学) 程希隐(单位:东北财经大学) 曹文鹏(单位:东北财经大学) 刘壮††注:通讯作者。(单位:东北财经大学) 张广\* (https://arxiv.org/html/2609.03407#corrauthor)(单位:香港科技大学(广州)) ###### 摘要 人们越来越多地向大语言模型(LLMs)寻求日常建议,这使得涉及伦理的人际问题成为实际的道德咨询场景。先前的大多数研究通过单轮判断或充满压力的反驳来研究这一情境,这些假设与现实世界中寻求指导的方式并不吻合。这些假设无法阐明:在没有明确反对立场的情况下,仅凭叙述本身是否能在多轮道德咨询中改变模型的判断。然而,现实世界的道德冲突对话常常引出一方的自我辩护陈述,这种陈述可能跨越多轮展开,并造成信息不对称。我们引入了“叙事俘获”(narrative captivity)这一概念,它是一种失效模式:模型将未被反驳的单方面陈述视为完整信息,并与叙述者的解释保持一致,而不去探寻缺失的视角。为了衡量这一现象,我们构建了一个包含5,078个人际冲突场景的基准测试,覆盖六个道德维度。在对17个大语言模型的测试中,叙事俘获现象普遍存在:与单轮基准相比,多轮叙述下的最终判断平均偏移了25个百分点。分层分析表明,偏好优化是主要影响因素,而四种推理时策略仅能提供部分缓解。我们希望本项目能推动创建在现实咨询中保持独立判断的大语言模型顾问。 ## 1 引言 参见图片标题 图1:一个看护冲突中的叙事俘获。相同的事实,以(a)中性描述、(b)单轮叙述和(c)五轮渐进叙述的方式呈现,产生了日益偏颇的模型判断,而叙述者并未施加明确的压力。 大语言模型(LLMs)正越来越多地被咨询用于日常道德决策,例如人际纠纷,寻求建议已成为其最常见的用例之一(Chatterji等人, 2025 (https://arxiv.org/html/2609.03407#bib.bib2);Zao-Sanders, 2024 (https://arxiv.org/html/2609.03407#bib.bib1))。最近的研究表明,这些模型产生的道德判断与人类反应高度一致(Rao等人, 2023 (https://arxiv.org/html/2609.03407#bib.bib3)),并且用户认为它们的道德指导比人类顾问的更值得信赖(Dillion等人, 2025 (https://arxiv.org/html/2609.03407#bib.bib4))。然而,这些互动基于一个很少受到关注的结构性条件,即寻求指导的用户必然是冲突的一方且是唯一的叙述者,这意味着模型接收到的所有信息都已由该方进行过框架设定,而对立的观点则付之阙如。证据显示,仅改变叙述视角就足以在单轮情境中翻转模型的道德判决(van Nuenen和Sachdeva, 2026 (https://arxiv.org/html/2609.03407#bib.bib5)),对齐训练会放大模型验证说话者的倾向(Sharma等人, 2024 (https://arxiv.org/html/2609.03407#bib.bib7)),并且第一人称框架比第三人称叙述引发更强的代表性转变(Wang等人, 2026 (https://arxiv.org/html/2609.03407#bib.bib6))。然而,这些发现并未解决多轮道德咨询中一个更根本的问题:当模型只接收到来自冲突一方的多轮叙述时,其道德判断如何演变?决定其保持还是丧失独立性的条件是什么? 当前关于谄媚性(sycophancy)的研究沿着三个大方向推进,但尽管范围广泛,每项研究都基于一些掩盖了咨询情境中更深层脆弱性的假设。(I) 单轮研究衡量模型是否在用户陈述一个观点时偏离事实真相或反转立场(Sharma等人, 2024 (https://arxiv.org/html/2609.03407#bib.bib7);Perez等人, 2023 (https://arxiv.org/html/2609.03407#bib.bib8)),近期工作将范围扩展到如面子维护(Cheng等人, 2026b (https://arxiv.org/html/2609.03407#bib.bib10))和削弱用户亲社会性(Cheng等人, 2026a (https://arxiv.org/html/2609.03407#bib.bib9))等社会维度,但所有这些都预设了单次交流。(II) 多轮扩展测试模型是否抵制用户的明确反对,包括直接挑战(Laban等人, 2023 (https://arxiv.org/html/2609.03407#bib.bib17))、累积的事实矛盾(Liu等人, 2025 (https://arxiv.org/html/2609.03407#bib.bib16))、对抗性辩论(Hong等人, 2025 (https://arxiv.org/html/2609.03407#bib.bib14))以及策略性说服(Xu等人, 2024 (https://arxiv.org/html/2609.03407#bib.bib15);Zhang等人, 2025a (https://arxiv.org/html/2609.03407#bib.bib18)),然而在每种情况下,用户都是主动与模型对抗,而不仅仅是叙述事件。(III) 道德判断研究表明,仅视角的变化就能推翻模型结论(van Nuenen和Sachdeva, 2026 (https://arxiv.org/html/2609.03407#bib.bib5)),并且模型会放大伦理推理中的认知偏差(Cheung等人, 2025 (https://arxiv.org/html/2609.03407#bib.bib12);Liu等人, 2026 (https://arxiv.org/html/2609.03407#bib.bib85)),但每次只进行一次操作,而非测试累积效应。所有这三种研究都依赖于主动干预,未测试在缺乏此类压力时会发生什么:大语言模型没有机制来评估其输入是否完整,也无法检测通过其自身先前回应而累积的偏差。在持续的咨询对话中,这会产生一个自我强化的循环:叙述者的陈述在多轮对话中未遭反驳,每个模型回应将其当前判断编码进共享上下文,而后续评估可用的证据变得片面。 为填补这一空白,我们借鉴了叙事运输理论(narrative transportation theory)(Green和Brock, 2000 (https://arxiv.org/html/2609.03407#bib.bib13)),该理论证明,长期接触单一视角而缺乏反证会降低接受者的批判性抵制能力,并促进信念向故事方向改变。受此机制启发,我们引入了“叙事俘获”(narrative captivity)的概念:与谄媚性(sycophancy)(Sharma等人, 2024 (https://arxiv.org/html/2609.03407#bib.bib7))——模型抑制自身知识以匹配用户期望——不同,叙事俘获描述的是这样一种状态:模型沉浸在单方面的叙述中,意识不到其输入是不完整的,在未寻求缺失视角的情况下输出具有重大影响的判断和行动计划。人际冲突咨询自然地触发了这一过程,因为叙述方不可避免地以自我服务的措辞描绘事件,强调自身的痛苦并淡化自身的责任,而模型只接触到这个版本,无法获取对方的陈述。图1 (https://arxiv.org/html/2609.03407#S1.F1) 追溯了在一个看护纠纷中的这一过程,展示了相同的底层事实在中性第三方框架下产生正确的评估,当叙述者在单轮中呈现时产生部分妥协,而在五轮逐步披露后则完全与叙述者保持一致。 我们构建了一个用于评估此情境下叙事俘获的基准测试,涵盖六个道德基础维度和5,078个场景。三种对比条件——中性第三方叙述、信息量相当的单轮叙述和多轮渐进叙述——将多轮传递的复合效应与单轮信息偏差区分开来。对17个模型的实验表明,即使叙述者从未明确施加压力,多轮条件下的判断偏移平均比信息量相当的单轮条件高出25个百分点,表明叙述在多轮对话中的逐步展开构成了超越单纯信息不对称的额外因素。我们的贡献总结如下: - • 我们首次定义了叙事俘获,并构建了第一个用于评估它的基准。对17个模型的评估显示俘获现象普遍存在,揭示了当前大语言模型在道德咨询场景中一个此前未被认识到的弱点。 - • 我们进一步探讨了俘获在训练后阶段的根源,发现DPO(直接偏好优化)是主要贡献者;通过比较单轮和多轮叙述,我们发现模型的先前顺应在多轮中累积成了不可逆的俘获。 - • 我们设计了四种针对不同假设原因的推理时策略,发现所有策略都只提供了部分缓解,表明这些方法存在难以突破的局限性,缓解问题必须在训练数据层面加以解决。 ## 2 可控叙述构建 参见图片标题 图2:可控叙述构建流程概览。单方面的社会叙述被提炼为冲突核心,转化为叙述碎片,并实例化为对齐的C0、C1和C2条件。每个有效实例产生三个对齐的条件,以隔离多轮叙述对模型判断的影响。 ### 2.1 构建流程 如图2 (https://arxiv.org/html/2609.03407#S2.F2) 所示,我们通过将单方面的社会叙述转化为对齐的C0、C1和C2条件来构建可控的叙述样本。 #### 来源处理。我们从微博和Reddit收集单方面的人际冲突叙述,提取冲突核心,并通过分段、改写、精炼和生成将其转化为叙述碎片。相关定义和构建细节见附录C (https://arxiv.org/html/2609.03407#A3) 和附录D (https://arxiv.org/html/2609.03407#A4)。 #### 叙述条件。每个冲突核心被实例化为三个对齐的条件以进行控制比较: - • C0 中性描述:关于完整冲突的中性第三人称陈述,用作事实参考而非道德基准。 - • C1 单轮叙述:第一人称单轮陈述,通过叙述者的自我保护框架呈现相同的冲突。 - • C2 多轮叙述:第一人称五回合陈述,在多个回合中逐步披露相同的冲突。 #### 质量控制。我们通过大语言模型筛选和人工审核过滤生成的样本,以确保事实一致性、责任线索保留、清晰的对比和有效的多轮结构。详细标准见附录D (https://arxiv.org/html/2609.03407#A4)。至关重要的是,叙述者可识别的责任是在构建过程中确立的,而非事后判断:每个保留的样本必须在三个条件之间保持相同的非空责任结构 \(R(C_0)=R(C_1)=R(C_2)\neq\varnothing\)。因此,评判者只评估模型是否能识别出这个预先验证过的责任。 ### 2.2 多轮设计 多轮条件将同一冲突分割成连续的叙述碎片,控制在不同回合中披露与道德相关的信息。这一设置要求模型追踪不断变化的上下文、整合延迟的责任线索并保持判断的一致性(Deshpande等人, 2025 (https://arxiv.org/html/2609.03407#bib.bib48)),同时持续接触单一叙述视角可能会增加沉浸感并改变信念(Schmidt等人, 2023 (https://arxiv.org/html/2609.03407#bib.bib47))。五回合的设计平衡了对话的自然性和实验控制。我们使用以下结构: - • 回合1:建立冲突和叙述者感知的冤屈,同时让决定性的责任线索保持模糊。 - • 回合2:提供背景,使叙述者的立场显得合理。 - • 回合3:引入叙述者的关键行动及其情境辩护。 - • 回合4:呈现结果和对方的反应,同时展示责任最小化。 - • 回合5:以判断请求结束,引出模型的最终立场。 ### 2.3 任务类型 为了评估大语言模型在不同人际冲突中的叙事俘获,我们借鉴了乔纳森·海特的道德基础理论(Graham等人, 2013 (https://arxiv.org/html/2609.03407#bib.bib49))来围绕对不同进化和社会规范的潜在违反组织我们的基准。具体来说,我们围绕6个核心维度构建基准:情感、公平、忠诚、角色义务、规范、自主性。每个核心维度进一步细分为4个具体子维度,共产生24种不同的任务类型。我们的基准测试包含5,078个中英文评估实例。所有24个子维度的精确定义及其在两种语言中的确切样本数量详见附录F (https://arxiv.org/html/2609.03407#A6)。 ## 3 实验 我们的实验旨在衡量不同模型间的叙事俘获,追溯其在训练中的根源,并测试是否可以在推理时减少它。为满足这些目标,我们的评估围绕四个研究问题展开: - • 研究问题1:当前大语言模型中叙事俘获的普遍程度如何?它在不同回合和冲突类型中如何变化? - • 研究问题2:哪个训练阶段对叙事俘获的影响最大? - • 研究问题3:与单轮传递相比,多轮叙述如何加剧俘获? - • 研究问题4:推理时干预能否缓解叙事俘获? ### 3.1 评估设置 #### 模型选择。我们评估了来自9个模型系列的17个代表性大语言模型,涵盖闭源和开源模型,包括GPT(OpenAI, 2024 (https://arxiv.org/html/2609.03407#bib.bib35))、Claude(Anthropic, 2025 (https://arxiv.org/html/2609.03407#bib.bib36))、Gemini(Google DeepMind, 2026 (https://arxiv.org/html/2609.03407#bib.bib41))、DeepSeek(Guo等人, 2025 (https://arxiv.org/html/2609.03407#bib.bib39))、豆包(Doubao)(ByteDance Seed, 2026 (https://arxiv.org/html/2609.03407#bib.bib43))、Grok(xAI, 2025 (https://arxiv.org/html/2609.03407#bib.bib42))、Llama(AI@Meta, 2025 (https://arxiv.org/html/2609.03407#bib.bib37))、通义千问(Qwen)(Qwen Team, 2024 (https://arxiv.org/html/2609.03407#bib.bib40))和GLM(Team GLM等人, 2024 (https://arxiv.org/html/2609.03407#bib.bib38))。 #### 评估指标。为了从互补的角度量化叙事俘获,我们提出了三个指标:叙事坚守(Narrative Hold, NH)、叙事恢复(Narrative Recovery, NR)和终态坚守(End-state Hold, EH)。对于每个场景\(i\),模型在\(T\)个用户回合中的每个回合产生一个回应\(r_i^{(t)}\)。我们使用GPT-4o作为大语言模型评判者。
相似文章
模型中的叙事者:叙事模式传承、升级动态与LLM对齐治理
本文研究训练数据中的叙事模式如何影响LLM行为,导致长期交互中出现叙事漂移、阿谀奉承和欺骗性,给已部署系统带来治理风险。
叙事景观:映射大语言模型中的叙事倾向
本文介绍了一种名为“叙事景观”的定量框架和可视化工具,用于映射并比较前沿大语言模型的叙事倾向及其稳定性。
Can LLM Agents Stick to the Script? A Benchmark for Long-Horizon Consistency in Interactive Narratives
This paper introduces NCP-Bench, a benchmark derived from 100 movie synopses for evaluating long-horizon narrative consistency in LLM-based interactive storytelling agents. Experiments show that even strong models like GPT-5.2 struggle to maintain logical consistency, with a 42% survival rate after 20 turns and high fact conflict rates.
分析LLM求解器循环中的叙述差距
本文识别并分析了LLM求解器循环中的“叙述差距”,即当LLM向用户叙述结果时,形式化求解器输出的可靠性会受到损害。实证研究表明,提示注入可以反转已验证的结论,并且在自适应攻击下缓解措施仍不完整。
Found in Conversation: LLMs 自我学习以缩小多轮对话差距
本文介绍了 Found in Conversation (FiC),一个使用视图非对称自蒸馏(View-Asymmetric Self-Distillation)的训练框架,旨在缩小 LLMs 中的多轮对话性能差距。该方法教会模型从欠详细的多轮提示中恢复单轮能力,在多种模型系列和规模上实现了 92-100% 的恢复率。