ANIMASK:模型在模拟故事世界中对角色扮演的贡献
摘要
ANIMASK 是一个模拟框架,它将书籍和剧本冻结为故事世界,以分析语言模型如何促进角色扮演,发现角色设定定义了角色身份,而模型默认值影响行为程度。
arXiv:2609.16667v1 公告类型:新
摘要:当语言模型扮演一个角色时,观察到的行为既反映了被分配的角色设定,也反映了演员模型本身的默认倾向。现有评估孤立地测试角色保真度或模型默认值,但在一个具有后果的具体选择上,两者都没有说明角色设定改变了什么以及模型默认保留了什么。我们引入 ANIMASK,一个模拟框架,它将书籍和剧本冻结为故事世界,其中角色基于自身动机行动,并从冻结点重新播放每个故事。我们保留作者的续写作为人类参考,通过故事内访谈验证每个角色设定持续存在,并在每个决策点比较角色移除角色设定后模型产生的行为。在40个故事、6个演员模型和3,846个决策点中,重播偏离其原作朝向一个共同方向,趋向更平淡、更冷静的故事,留下紧张关系开放。角色设定始终存在并被遵守。在四分之三的选择中,模型默认值已经落在角色设定接受的范围内,当两者分歧时,模型是谨慎的一方,在角色设定会推进的地方保持克制。角色设定保证了角色是谁,而模型设定了角色能走多远。
查看缓存全文
缓存时间: 2026/09/16 09:02
# 模型在模拟故事世界中对角色扮演的贡献
来源:https://arxiv.org/html/2609.16667
Xiucheng Zhang, Zhuoning Xu, Hanjun Luo, Yankai Chen, Hanan Salam, Xue Liu†
†† 电子邮件:xz5473@nyu\.edu
†† 通讯作者:hl6266@nyu\.edu
###### 摘要
当语言模型扮演一个角色时,其观察到的行为反映了被赋予的人格以及执行模型本身的默认倾向。现有评估分别测试人格保真度或模型默认行为,但都无法明确指出在某个有实际影响的选择中,人格改变了什么,模型默认保留了什么。我们引入了ANIMASK,一个将书籍和剧本冻结成故事世界的模拟框架,其中角色根据自身动机行动,并从冻结点重新演绎每个故事。我们将作者的续写作为人类参考,通过故事内访谈验证每个人格是否持续存在,并在每个决策点将角色行为与移除人格后模型产生的行为进行比较。在40个故事、6个执行模型和3,846个决策点上,重播结果都朝着一个共同方向偏离原著,趋向更平淡、更冷静且留下未解决紧张关系的故事。人格始终存在并被遵守。在四次选择中有三次,模型的默认行为已处于人格接受的范围内;在两者分歧时,模型表现更为谨慎,会在人格坚持的地方保持克制。人格保证了角色的身份,而模型决定了角色行动的限度。代码可在 github\.com/Xiucheng\-Zhang/ANIMASK (https://github.com/Xiucheng-Zhang/ANIMASK) 获取。
## 1 引言
大型语言模型(LLM)现在常扮演具有特定身份的角色。它们作为模拟社会中的智能体(Park等人,2023)、伴侣聊天机器人(Skjuve等人,2021)、游戏NPC(Gallotta等人,2024)和合成调查受访者(Argyle等人,2023)而行动。每个角色都携带一个被赋予的人格——一个通过模型提示安装的、包含特质、关系和目标的结构化档案。然而,人格并非作用于一个中立的模型。执行模型带有默认倾向,这些倾向由预训练和后训练塑造,在其扮演的任何人格下都持续存在。我们探讨观察到的行为中有多少来自被赋予的人格,又有多少来自执行模型本身。这个问题的答案在将模型扮演的角色视为个人时至关重要,因为观察者默认看到的是角色本身,而非模型。
两种研究路径从相反角度探讨这一问题。角色扮演保真度研究将角色安装在LLM上,并评估模型扮演该角色的忠实程度(Samuel等人,2025),探查知识(Ahn等人,2024)、人格(Wang等人,2024a)以及交互中的漂移(Li等人,2024;Choi等人,2025)。模型默认行为研究则测量模型自身表现出的观点、价值观和行为倾向(Santurkar等人,2023;Sharma等人,2024;Lu等人,2026;Wu等人,2024)。两者均无法提供本文所需的归因分析。它们通常评估的是在多角色交互、利益冲突和选择影响他人之外的行为。对整个角色的保真度评分无法说明某个特定选择在没有人格的情况下是否相同。因此,核心问题仍然开放:在具有实际影响的多角色交互中,人格贡献了什么?模型贡献了什么?
书籍和剧本提供了这种归因分析所需的条件。它们为角色提供了明确的人格、关系和冲突目标,并置于不断发展的社会背景中,包含制度、规范和未解决的张力。这些角色在长周期内互动,并反复做出影响他人的选择。源文本记录了作者在我们冻结点之后如何继续故事。这一续写——原著——为相同上下文中的相同角色提供了参考(图示)。丰富的人格使被赋予的角色可测试,有实际影响的选择揭示了模型的作用,而原著则为共同偏离提供了方向基准。
我们介绍了ANIMASK(ANIma + maSK),一个将书籍或剧本转化为故事世界,并由模型扮演角色进行重播的模拟框架(图1)。它将源文本冻结在情节的特定点,在共享的执行模型上重建世界及其角色作为人格,并让故事从此继续。没有模块引导情节。角色依据自身动机行动,世界按自身节奏推进,重播在中心张力解决或故事停止发展时结束。因此,在同一执行模型下重播的不同故事产生独立轨迹,跨故事比较聚焦于角色的选择以及产生这些选择的人格与模型组合。
针对该框架,我们设计了一个结合故事层面评分、故事内人格访谈和决策点人格移除的测量方案。问卷定期在相同量表上对每次重播及其原著进行评分,揭示不同故事的重播是否朝着共同方向漂移。故事内访谈验证每个人格是否持续存在,而每个决策点的控制性人格移除则比较角色行为与模型单独行为的差异。这些提供了收敛证据。故事层面识别出需要解释的共同趋势,决策层面则将其追溯到模型默认行为在持续存在的人格下的运作。
在来自不同供应商的40个故事和6个执行模型中,重播结果趋于收敛。它们朝着一个共同方向偏离原著,趋向更平淡、更冷静且中心张力未解决的故事。240次重播中只有7次以目标达成告终。最常见的结局是僵局:角色维持目标,避免不可逆转的行动并等待。人格并非原因。访谈发现它们从第一个检查点到最后一个都持续存在。分面均值在百分制上介于87至96之间,所有六个执行模型下的漂移中位数均为零。驱动收敛的原因在3,846个决策点显现。四次选择中有三次,模型的默认行为已处于人格接受的范围内。因此,人格被遵守主要是因为模型本就会做出人格所要求的行为。人格改变结果的情况不足五分之一。当人格与模型分歧时,模型是谨慎的一方。六次选择中,有一次默认行为在人格会坚持的地方保持克制。在人格要求越界的情况下,五个模型中有五个在五次中有四次让角色保留了该要求。了解角色并不能弥合这一差距。角色的访谈评分无法预测其人格能在多大程度上影响其选择。人格保证了角色的身份,而模型决定了角色行动的限度。
我们的贡献如下:
- ❶ 归因机制。我们引入ANIMASK,将书籍和剧本冻结成故事世界,并由模型扮演角色进行重播。为此设计的测量方案对重播进行评分,验证人格存在性,并在每个决策点区分人格改变的内容与模型默认保留的内容。
- ❷ 故事层面证据。在40个故事和6个执行模型中,重播结果朝着一个共同方向偏离原著,同时人格持续存在。这建立了模型驱动的趋势,由决策层面进行解释。
- ❸ 决策层面解释。在3,846个决策点,模型默认行为已覆盖人格要求的大部分内容。当两者分歧时,模型设定了更谨慎的行为边界。
## 2 相关工作
社会与叙事世界中的智能体。生成式智能体模拟将LLM支持的角色置于共享环境中,并观察涌现的集体行为(Park等人,2023;Vezhnevets等人,2023;Zhou等人,2024b;Piao等人,2026;Yang等人,2025)。即使在相同指令下,切换底层模型也会改变集体结果(Piatti等人,2024;Akkil等人,2026;Akata等人,2025),因此执行模型在模拟中留下了印记。然而,涌现行为通常归因于智能体设计,人格和模型在单个决策中的贡献并未分离(Larooij & Törnberg,2026;Anthis等人,2025;Zhou等人,2024a)。另一条路径使用语言模型生成故事,从早期的神经故事生成(Fan等人,2018;Yao等人,2019),到编剧和互动戏剧,再到基于小说的世界模拟(Mirowski等人,2023;Wu等人,2025;Wang等人,2024b;Chen等人,2026;Ran等人,2025)。这些系统评估生成叙事的质量,当模型突破其角色时,漂移被视为缺陷(Han等人,2024;Magee等人,2024)。在这两条路径中,模型对任何单个角色选择的贡献都未被识别。ANIMASK使用类似的故事世界作为归因环境,而非故事生成。
人格保真度与模型默认行为。角色扮演保真度研究通过提示或角色特定训练将角色安装到LLM上(Chen等人,2024;Wang等人,2024c;Shao等人,2023;Wang等人,2025b,见综述)。它们评估模型扮演角色的忠实程度,通过知识探查(Ahn等人,2024)、人格访谈(Wang等人,2024a)、原著选择点(Xu等人,2025a)以及长对话中的漂移(Li等人,2024;Choi等人,2025;Ko & Geiping,2026)。模型默认行为研究则测量另一面——助手人格(Shanahan等人,2023;Andreas,2022;Lu等人,2026),包括其自身的观点和价值观(Santurkar等人,2023;Mazeika等人,2025)、谄媚倾向(Sharma等人,2024;Cheng等人,2025),以及它导致的输出多样性窄化(Wu等人,2024;Kirk等人,2024;Jiang等人,2025;Xu等人,2025b)。每条路径都发现模型的倾向与人格相互作用。人格效应随模型变化的幅度大于随人格变化的幅度(Hu & Collier,2024;Beck等人,2024;Wang等人,2025a),保真度对不太道德的角色下降(Jun等人,2026;Yi等人,2025;Lai等人,2026),且陈述的信念无法控制角色内行为(Mooney等人,2026;Mannekote等人,2025)。但行动中的角色同时携带两种来源,两条路径都未将特定选择归因于其中一方。我们验证人格持续存在,然后在相同决策点移除它,以识别模型单独贡献的部分。
## 3 问题设定
#### 人格条件轨迹。令 M 表示扮演主要角色的执行模型,W 表示冻结的故事世界,C = {c₁, ..., cₖ} 表示演员表的人格。在每个步骤 t,角色 k(t) 在其人格 cₖ(t) 和交互历史 hₜ 下行动,从执行策略 π_M(aₜ | cₖ(t), hₜ) 中抽取动作。环境通过世界确定的转换 Q_W(hₜ₊₁ | hₜ, aₜ) 更新历史,该转换实现场景推进、后果和背景事件。一次完成的重播是从 P(τ | M, C, W) = ∏_{t=1}^T π_M(aₜ | cₖ(t), hₜ) Q_W(hₜ₊₁ | hₜ, aₜ) 中抽取的轨迹 τ = (h₁, a₁, ..., hₜ, aₜ, hₜ₊₁),其中 h₁ 由 W 固定,k(t) 命名步骤 t 的行动角色。每个角色都是同一 π_M 的条件,因此策略和转换共同决定轨迹。由于 π_M 同时反映人格和模型自身的倾向,仅观察 τ 无法分离两种来源。在 Q_W 固定的情况下,重播允许两种干预:在保持 W 和 C 不变的情况下替换执行模型 M,以揭示共同趋势是否随模型变化;在决策点保持 M、W 和 hₜ 不变的情况下移除单个人格 cₖ,以孤立人格的局部贡献。
#### 分离人格与模型贡献。在单个决策中,人格和模型作为策略的两个因素起作用。我们采用操作性分解 π_M(a | c, h) ∝ q_c(a | h) w_M(a | h),其中 q_c 按人格对该动作的要求强度加权,w_M 按模型自身产生该动作的意愿(无论人格如何)加权。这种分解组织了相似文章
PersonaArena:用于评估和增强大语言模型中人格层面角色扮演的动态模拟框架
PersonaArena 是一个动态模拟框架,利用大规模社交内容语料库和多智能体辩论评判机制,评估并提升大语言模型在真实社交场景中保持连贯且真实的人格层面角色扮演能力。
模拟一切,差不多如此:世界模型的承诺与局限
一篇Ars Technica的文章探讨了世界模型作为新兴人工智能范式的承诺与局限,将其与大语言模型进行对比,并邀请了专家就其在机器人、研究和资产生成中的应用提供见解。
从记忆到行为:面向社交媒体影响者的行为感知角色扮演框架
本文介绍了一个名为SIBPersona的行为感知角色扮演框架,通过整合依赖情境的行为策略和针对不知名个体的评估协议,以增强模仿社交媒体影响者的真实性。
Deep Persona: 一个基于心理学的角色扮演代理和模拟架构及评估框架
本文介绍了Deep Persona,一个基于心理学的角色扮演代理架构,并提出了一个评估框架。对LLMs进行评估后发现,尽管语用流畅度高,但在情感表达方面存在系统性限制。
迈向定制化的多模态角色扮演
本文介绍了 UniCharacter,这是一个用于定制化多模态角色扮演(CMRP)的两阶段训练框架,能够对人设、对话风格和视觉身份进行统一的定制。该研究提出了 RoleScape-20 数据集,并证明了该模型仅需极少数据即可实现连贯的跨模态生成。