单一策略,无限NPC:面向可扩展游戏角色的角色追溯共享强化学习策略
摘要
提出PCSP,一种基于冻结LLM角色描述嵌入的单一强化学习策略,可在生活模拟游戏中实现可扩展、实时的角色可追溯NPC控制。实验表明,该方法实现了零样本角色识别和行为对齐,推理速度比LLM基线快。
arXiv:2605.23652v1 公告类型:新
摘要:在一个300角色生活模拟基准测试中,pcsp实现了组合式零样本角色识别(比随机高17倍)、Spearman rho约0.73的语义-行为对齐,以及比LLM作为策略基线快22倍的推理速度。生活模拟游戏需要数百至数千个非玩家角色(NPC),这些角色需在行为上与不同个性保持一致,同时仍可通过设计师编写的自然语言进行控制。现有方法无法满足角色一致性、可控性或实时推理等约束。我们提出pcsp(角色条件共享策略),这是一种基于冻结LLM自由形式角色描述嵌入的单一强化学习策略。pcsp结合了每个NPC一次的角色编码、低秩角色投影、神经角色条件以及PPO + InfoNCE一致性 + KL多样性训练目标。在三个实验设置中,消融实验表明InfoNCE轨迹一致性目标至关重要:移除它会使零样本角色识别降至随机水平。在Melting Pot 2.4.0基板上的外部验证证实,我们的方法在多智能体策略环境中产生了角色条件行为差异。我们区分了两种保留评估的意义:组合式零样本和词汇扩展保留。最后,在UE5部署中,以低失败率在引擎中复制了64个智能体的角色条件消融实验,表明亚帧推理配置文件在商业游戏引擎中仍能存活。这些结果证明,共享强化学习策略可以支持可扩展、实时的角色条件NPC控制。
查看缓存全文
缓存时间: 2026/05/25 08:58
# 个性可追溯的共享强化学习策略:可扩展的游戏智能体
来源:https://arxiv.org/html/2605.23652
## 一个策略,无限NPC:个性可追溯的共享强化学习策略,实现可扩展的游戏智能体
###### 摘要
在一个300人格的生活模拟基准测试中,pcsp 实现了组合式零样本个性识别(未见职业保留),性能高达随机水平的17倍,语义-行为对齐的 Spearman ρ≈0.73,推理速度比LLM作为策略的基线快22倍。生活模拟游戏需要数百到数千个非玩家角色(NPC),这些角色在保持与不同个性一致的同时,还需能通过设计师编写的自然语言进行控制。手工编写的行为树、每个角色的RL策略、无监督技能发现以及每步LLM控制器,均无法满足一项或多项部署约束:个性一致性、自然语言可控性、零样本泛化能力以及实时推理。我们提出 pcsp(个性条件共享策略),这是一种单一的强化学习策略,其条件基于冻结的LLM嵌入向量,这些嵌入向量由自由形式的个性描述生成。pcsp 结合了每NPC一次的个性编码、低秩个性投影、神经个性条件化,以及PPO + InfoNCE一致性 + KL多样性的联合训练目标。在三个 pcsp-d(原 Mini-Inzoi)实验设置中(包括更丰富的20动作v3本体),消融实验表明 InfoNCE 轨迹一致性目标是核心:移除该目标会导致零样本个性识别能力崩溃至随机水平,即使任务奖励得以保持或改善。在 Melting Pot 2.4.0[15 (https://arxiv.org/html/2605.23652#bib.bib16)] 的三个代表公共池、公共物品和双人矩阵社会困境的基板(commons_harvest__open, clean_up, prisoners_dilemma_in_the_matrix__repeated)上进行的外部验证证实,§III (https://arxiv.org/html/2605.23652#S3) 方法能在多智能体策略交互基板中产生个性条件化的行为分歧,并且一致性损失的消融使得每个基板中的轨迹→个性检索能力崩溃至随机水平,同时保留或增加成对动作KL散度。我们区分了两种保留评估的意义:*组合式零样本*(已训练个性空间覆盖范围内的未见职业×原型交叉;层1和层3的范围),以及*词汇扩展保留*(新的个性标记,其嵌入位于训练嵌入的凸包内,但训练时从未出现过;层2仍然失败的范围,top-1=0,我们将其报告为一个开放问题)。UE5部署在64个智能体上重现了引擎内的个性条件化消融实验,失败率为1.7%,保留零样本泛化的失败率为0.04%,表明子帧推理特性和消融结构在迁移到商业游戏引擎后仍然存在。这些结果提供了实证证据,表明共享的RL策略可以支持可扩展、实时、个性条件化的NPC控制,并且轨迹可追溯性是该方法的核心。
## I. 引言
现代生活模拟游戏——《模拟人生》、《动物森友会》、《inZOI》以及新兴的开放世界游戏——将NPC置于玩家体验的核心。为了让这些游戏感觉生动,每个NPC都必须以与其独特个性一致的方式行事:善于社交的厨师和隐居的艺术家应该通过明显不同的活动模式、社交方式和日常节奏来追求相同的生理需求。在规模上——每个游戏世界有数百到数千个NPC——这构成了当前游戏AI架构在设计上无法解决的根本性挑战。
### I-A NPC个性化扩展差距
#### 行为树仍然是工业标准[35 (https://arxiv.org/html/2605.23652#bib.bib22),7 (https://arxiv.org/html/2605.23652#bib.bib44)]。经验丰富的设计师为每个角色原型手工制作决策逻辑。这能产生可信、可预测的NPC,但创建成本随角色数量线性增长,并且行为树在作者设定的场景之外很脆弱。一万个不同的NPC个性需要一万棵手工制作的树。
#### 每个NPC的RL似乎提供了自动化:为每个人格训练一个独立的策略。原则上,这允许无限的角色和任意行为。但实际上,内存和训练成本也线性增长,每个新人格都需要完整的重新训练周期——对于定期引入新角色的在线服务游戏来说,这是一笔高昂的成本。
#### LLM作为策略的方法[19 (https://arxiv.org/html/2605.23652#bib.bib8),33 (https://arxiv.org/html/2605.23652#bib.bib9),36 (https://arxiv.org/html/2605.23652#bib.bib10),26 (https://arxiv.org/html/2605.23652#bib.bib41),34 (https://arxiv.org/html/2605.23652#bib.bib40)]通过在每一步决策时查询语言模型来实现丰富、基于自然语言的人格表达。这在离线或回合制环境中效果很好,但即使是我们的本地 Qwen3-1.7B LLM作为策略的基线,每个决策步骤也需要43.7毫秒(表XI (https://arxiv.org/html/2605.23652#A1.T11)),这超过了实时游戏模拟每帧16-33毫秒的预算。生成式智能体[19 (https://arxiv.org/html/2605.23652#bib.bib8)]通过按分钟级别的计划而非逐帧操作来规避此问题,这适用于叙事模拟,但无法驱动实时的NPC运动和活动选择。
#### 无监督技能发现(DIAYN[9 (https://arxiv.org/html/2605.23652#bib.bib6)], CIC[14 (https://arxiv.org/html/2605.23652#bib.bib7)]),通常与内在动机目标[20 (https://arxiv.org/html/2605.23652#bib.bib35)]结合,学习一个以潜在技能码为条件的共享策略,实现行为多样性而无需逐角色训练。但技能码不包含任何语义内容。游戏设计师无法通过选择潜在索引来指定“这个NPC应该随和且注重健身”。自然语言可控性不是其设计的一部分。
### I-B 个性条件化共享策略
我们用一种不同的分解方法来解决这个扩展问题:*为每个NPC计算一次丰富的个性表示,然后在每一步将单一的轻量级策略以该表示作为条件*。关键推动因素是现代的LLM嵌入空间。一个冻结的语言模型将自由形式的个性描述映射到密集向量,这些向量捕获人格之间的语义关系。以此类嵌入为条件的共享策略可以泛化到设计师编写的*任何*人格,而无需重新训练,因为连续的嵌入空间提供了对整个流形覆盖。在推理时,LLM在每个NPC生命周期中被调用一次;策略网络——最多几百KB——以全速运行。这种方法,我们称之为*个性条件化共享策略*,在游戏AI中尚未得到充分探索。本文提出了一个具体实现 pcsp,并评估了在什么条件下可以从生成的轨迹中恢复个性条件化的行为。核心实证问题不在于策略是否能将个性化文本作为输入,而在于其轨迹是否保留了足够的个性化信号,以支持零样本识别、语义对齐和实时部署。
### I-C 本文贡献
1. **方法**。pcsp——通过低秩个性投影(LoRA风格的矩阵分解,用作独立的投影层,而非预训练权重上的并行适配器)和FiLM/拼接融合,以冻结的LLM个性嵌入为条件的共享策略,并与PPO、InfoNCE轨迹一致性目标和KL多样性正则化(§III (https://arxiv.org/html/2605.23652#S3))共同训练。
2. **三层验证方法**。我们认为个性条件化智能体需要对机制、泛化和部署进行*分离*验证,并通过受控诊断基板(pcsp-d)、外部多智能体RL基板(Melting Pot)和实时UE5引擎部署(§IV (https://arxiv.org/html/2605.23652#S4))实例化这一点。
3. **机制发现(层1)**。在受控条件下,InfoNCE一致性项是轨迹级个性可恢复性的因果原因:移除该项可以保持任务奖励,但在pcsp-d的三个独立环境实例中,零样本个性识别能力崩溃至随机水平(§V (https://arxiv.org/html/2605.23652#S5))。
4. **外部泛化(层2)**。相同的方法,除了增加了CNN观察前端外无需算法修改,就能迁移到三个涵盖公共池、公共物品和双人矩阵结构的 Melting Pot 社会困境基板(commons_harvest__open, clean_up, prisoners_dilemma_..._repeated);在所有三个基板中,一致性损失的消融使得轨迹→个性检索能力崩溃至随机水平,同时保留或增加成对动作KL散度(§VI (https://arxiv.org/html/2605.23652#S6))。在整个12人格词汇表上的检索仍保持在随机水平top-1的3.4–4.9倍,并且从CU→CH的跨基板个性投影和轨迹编码器迁移实现了1.79倍随机水平top-1的检索(§VI-A (https://arxiv.org/html/2605.23652#S6.SS1),表VII (https://arxiv.org/html/2605.23652#S6.T7))。
5. **部署发现(层3)**。冻结的层1检查点在UE5中部署,支持64个并发个性条件化智能体实时运行,失败率为1.7%,泛化到60个保留人格的失败率为0.04%,并且*在引擎内重现了InfoNCE消融实验*(完整检查点与no_consist检查点之间匹配人格的对称KL散度为1.79纳特,在同一地图和人格集上的奖励分别为1,423.5 vs. 1,079.8),表明一致性目标在引擎侧资源争用下仍然起核心作用(§VII (https://arxiv.org/html/2605.23652#S7))。
6. **可重复性**。开源ONNX检查点、三层基准测试代码、UE5插件和轨迹标注工具。
## II. 为什么当前范式存在不足
表I (https://arxiv.org/html/2605.23652#S2.T1) 根据实际生活模拟NPC部署的四个关键维度评估了六种范式。
**表 I: 范式比较。** ✓ = 满足,× = 不满足,△ = 部分满足。pcsp 行报告的是 *在我们评估的设置中*(§IV (https://arxiv.org/html/2605.23652#S4) 的三层堆栈)的满足情况;开放问题,如Melting Pot词汇扩展保留恢复(§VI-A (https://arxiv.org/html/2605.23652#S6.SS1))、更广泛的人类可信度以及超越层3的开放世界泛化,将在§IX (https://arxiv.org/html/2605.23652#S9) 中讨论。
#### 目标条件化RL。UVFA[24 (https://arxiv.org/html/2605.23652#bib.bib2)] 和 HER[1 (https://arxiv.org/html/2605.23652#bib.bib3)] 以目标*状态*为条件——要实现什么。个性描述的是*如何行为*:两个需求相同但个性不同的NPC应通过不同的活动序列来满足需求。目标条件化处理的是错误的变异轴,并且不提供自然语言接口。
#### 语言条件化RL。BabyAI[5 (https://arxiv.org/html/2605.23652#bib.bib4)] 以每个回合变化的自然语言*指令*为条件。个性是NPC生命周期中持续存在的稳定特征;将其视为回合级指令会丢弃长期一致性约束。Decision Transformer[4 (https://arxiv.org/html/2605.23652#bib.bib5)] 和类似的序列建模方法以过去的回报或目标为条件,但不以必须零样本泛化的静态身份描述符为条件。
#### 无监督技能发现。DIAYN[9 (https://arxiv.org/html/2605.23652#bib.bib6)] 和 CIC[14 (https://arxiv.org/html/2605.23652#bib.bib7)] 通过学习潜在编码实现行为多样性,但这些编码不包含语义内容。泛化到设计师指定的新人格需要解决逆向问题:找到“一个优先考虑学习的内向会计”的潜在编码。这在设计上不支持。
#### LLM作为策略。生成式智能体[19 (https://arxiv.org/html/2605.23652#bib.bib8)]、Voyager[33 (https://arxiv.org/html/2605.23652#bib.bib9)] 和 ReAct[36 (https://arxiv.org/html/2605.23652#bib.bib10)] 能产生丰富、人格一致的行为,但当作为每步控制器使用时成本仍然很高。在我们的基准测试中,Qwen3-1.7B LLM作为策略的基线每个决策步骤需要43.7毫秒(表XI (https://arxiv.org/html/2605.23652#A1.T11)),已经超出16-33毫秒的帧预算。动作缓存、计划重用和更小蒸馏模型等技术可以减少延迟,但根本性的矛盾——丰富的语言推理与实时的步长预算——依然存在。Gato[22 (https://arxiv.org/html/2605.23652#bib.bib11)] 等通用智能体表明单一模型可以处理多种任务,但推理成本类似。AlphaStar[32 (https://arxiv.org/html/2605.23652#bib.bib32)]、OpenAI Five[3 (https://arxiv.org/html/2605.23652#bib.bib33)] 和 AlphaZero[27 (https://arxiv.org/html/2605.23652#bib.bib34)] 等大规模自对弈智能体证明了RL可以掌握复杂游戏,但它们是将单一策略专门用于单一游戏,而不是在一个世界中表达一个词汇表的人格。
#### 总结。没有一种现有范式能满足所有四个维度。“快速但无NL控制”和“NL控制但太慢”之间的设计空间尚未得到系统探索。个性条件化共享策略是关于如何弥合这一差距的一个具体方案。
## III. pcsp:个性条件化共享策略
我们将 pcsp 定位为个性条件化共享策略设计空间中的一个特定点。以下组件基于消融证据,但并非规范;它们定义了在§IV (https://arxiv.org/html/2605.23652#S4) 三层验证中评估的实验系统。该方法本身是*环境无关的*:一个冻结的嵌入加上低秩个性投影、一个带条件融合的共享策略,以及PPO+InfoNCE+KL联合训练目标。环境、观察、动作和奖励规范将推迟到§IV (https://arxiv.org/html/2605.23652#S4),连同它们实例化的层一起介绍。
### III-A 个性编码
给定个性文本 p,我们使用基于 Transformer[31 (https://arxiv.org/html/2605.23652#bib.bib38)] 的 Qwen3-0.6B-Embedding[39 (https://arxiv.org/html/2605.23652#bib.bib21)](最后token池化,L2归一化)计算一个冻结的LLM嵌入向量 ê_p ∈ R^{1024};对比训练得到的句子编码器,如 Sentence-BERT[23 (https://arxiv.org/html/2605.23652#bib.bib39)],为我们下面的B3基线提供支持。这在每个NPC生命周期中计算一次(14.6毫秒/人格),几乎不增加运行时负担。一个学习到的低秩个性投影(r=16, lr=10^{-4})通过一个低维投影层将 ê_p → e_p ∈ R^{64},该层的矩阵分解结构受 LoRA[13 (https://arxiv.org/html/2605.23652#bib.bib18)] 启发——我们不是在 Qwen3 骨干网的预训练权重矩阵上添加一个并行的 BA 适配器;而是将独立的 1024→64 个性投影分解为秩为16的 BA,以保持可学习的个性通路较小,同时保持嵌入模型冻结:
e_p = norm(α B A ê_p),
A ∈ R^{16×1024}, B ∈ R^{64×16}, α = 64^{-1/2}.相似文章
超越合作模拟器:为LLM代理的稳健评估生成逼真的用户角色
提出了Persona Policies(PPol),一种即插即用的控制层,利用LLM驱动的进化程序搜索来生成多样且逼真的用户角色,用于评估LLM代理。相比基线实现了33-62%的适应度提升,逼真度评分达到80.4%,并将代理鲁棒性提升了+17%的任务成功率。
PersonaArena:用于评估和增强大语言模型中人格层面角色扮演的动态模拟框架
PersonaArena 是一个动态模拟框架,利用大规模社交内容语料库和多智能体辩论评判机制,评估并提升大语言模型在真实社交场景中保持连贯且真实的人格层面角色扮演能力。
BiPACE: 面向LLM智能体的双模拟引导策略优化与动作反事实估计
BiPACE提出了一种即插即用的优势估计器,用于修复LLM智能体逐步分组强化学习中的状态-动作信用分配错配问题。该方法利用双模拟引导的状态聚类和动作反事实估计,在ALFWorld、WebShop和TextCraft基准上,配合Qwen2.5模型实现了显著的性能提升。
超越借用历史:面向交互式角色扮演评估的个性化用户模拟
介绍了PALATE,一个可扩展的基准,用于评估角色扮演智能体,使用个性化对齐的LLM模拟用户和个性化评分标准,解决了固定历史评估的局限性。
超越静态人格:大型语言模型的情境人格引导
本文介绍了IRiS,一种无需训练的情境人格引导框架,它通过识别和利用情境依赖的人格神经元,超越了静态人格建模。该方法表明,大型语言模型的行为随情境变化,并提出了基于神经元的识别、检索和加权引导方法,在PersonalityBench和新增的SPBench基准上得到验证。