社会模拟中语言模型的角色引导

arXiv cs.CL 论文

摘要

介绍了一种用于社会模拟中角色条件化LLM智能体的激活引导筛选工作流,在OLMo-3-7B-Instruct上对275个角色清单进行了评估,结果显示角色特定方向优于助手轴方向控制。

arXiv:2608.00023v1 公告类型:新 摘要:由语言模型智能体构建的社会模拟需要角色条件化行为,这种行为可以在智能体被放入模拟群体之前进行检查。我们引入了一种用于角色条件化智能体的激活引导筛选工作流:定义角色档案,提取角色特定方向,扫描四个引导系数,评估角色档案对齐度,并对每个候选配置进行通过或标记。在OLMo-3-7B-Instruct上,我们将该工作流应用于一个包含275个角色的混合清单,其中包括228个与角色无关的问题、由GPT-4.1-mini提示生成的角色参考,以及由GPT-4.1-mini担任评估者。角色特定方向获得的角色档案对齐度评分高于先前人物向量工作中的助手轴方向控制,在测试网格上的平均总分为63.2,而后者为41.1。它们还保持了较高的词汇多样性,而控制方法在较大系数下急剧下降。角色级筛选是主要的实际输出:大多数角色随着引导增强而改善,但有38个角色在所有六个测量维度上均下降,这表明为什么模拟构建者应该为每个角色选择系数,而不是采用统一的高强度设置。我们已在 https://anonymous.4open.science/r/anonymous-research-code-5F03/ 提供我们的代码和评估工件。
查看原文
查看缓存全文

缓存时间: 2026/08/04 07:36

# 语言模型在社交模拟中的角色引导
来源:https://arxiv.org/html/2608.00023

Isaac Song¹,Mohammed Rehan Parwani¹,Glenn Matlin¹,²,Emile Anand¹,Akhil Theerthala⁷,Arjun Chatterjee³,Maria Kostylew²,⁴,Yonadav G. Shavit⁶,Sebastien Krier⁵,Mark Riedl¹

1 佐治亚理工学院,美国佐治亚州亚特兰大
2 ML Alignment & Theory Scholars \(MATS\),美国加州伯克利
3 伊利诺伊大学厄巴纳-香槟分校,美国伊利诺伊州厄巴纳
4 牛津大学,英国牛津
5 Google DeepMind,英国伦敦
6 OpenAI,美国加州旧金山
7 独立研究员

###### 摘要
基于语言模型智能体的社交模拟需要角色条件化行为,并且这种行为应在智能体被放入模拟群体之前就可核查。我们提出了一种面向角色条件化智能体的激活引导(activation-steering)筛查工作流:定义角色画像,提取角色特定方向,扫描四个引导系数,评估角色画像对齐度,并对每个候选配置给出通过或标记。在 OLMo-3-7B-Instruct 上,我们将该工作流应用于包含 275 个角色的混合角色清单、228 个与角色无关的问题、GPT-4.1-mini 提示生成的角色参考以及 GPT-4.1-mini 评判器。角色特定方向在评判所得的角色画像对齐度上优于先前 persona-vector 工作中基于 assistant 轴的方向控制,在测试网格上平均总分为 63.2,而对照为 41.1。同时,角色特定方向保持了较高的词汇多样性,而控制方向在较大系数下急剧下降。角色级筛查是主要实用产出:大多数角色随引导增强而对齐度提升,但 38 个角色在所有六个测量维度上均呈下降趋势,这表明模拟构建者应为每个角色单独选择系数,而非统一采用高强度的设置。我们的代码和评估工件可在 https://anonymous.4open.science/r/anonymous-research-code-5F03/ 获取。

## 1 引言
基于语言模型智能体的社交模拟继承了这些智能体中编码的假设。工作场所、公民过程、平台社区或机构工作流可能需要展现不同优先级、语域、社会立场和决策风格的智能体。提示模型“扮演”某个角色虽然方便,但微小的提示改动就可能改变行为,指令遵循可能会漂移,模拟群体也可能变得扁平化或错误描绘异质性(li_measuring_controlling_2024;lutz_prompt_makes_2025;tosato_persistent_instability_2025)。对于社交模拟,这造成了归因问题:观察到的交互模式可能反映的是预期的角色群体、角色提示的措辞,或底层模型共享的偏差(qu2026traininggeneralizablecollaborativeagents;anand_meanfield_sampling_2025;anand2026learningapproximatenashequilibria;horwitz2026structurestrategicinteraction)。我们研究激活引导,将其作为在智能体被用于模拟之前使角色构建可度量的一种方式。我们不反复用自然语言指定角色,而是从模型的激活空间中提取一个方向,并在生成过程中将其加入。这种干预暴露了一个标量系数,可以在保持模型、问题和解码设置固定的情况下对其进行变化。先前工作表明,与 persona 和角色相关的方向可以被提取并用于调节行为(chen2025persona;lu2026assistant;poterti_can_role_2025;bas_what_can_2026;anand_continuous_latent_2026)。在这些文献中,lu2026assistant 的 Assistant Axis 是一个与默认助手式行为相关的参考方向,而非我们清单中任何目标角色。我们将 assistant 轴引导用作*方向控制*:一个与 persona 相关的方向,使用相同的问题和系数网格进行评估,但并非旨在编码特定角色的画像。

社交模拟需要的不仅是证明引导能改变输出。方法论问题是如何将该机制转化为可重复的智能体构建工作流:定义多个角色、提取候选方向、一致地评估它们、选择系数,并识别出更强引导适得其反的角色。我们通过在 OLMo-3-7B-Instruct(teamolmo2025olmo3)上使用一个混合的 275 角色清单来探讨这个问题。对于每个角色,我们构建一个结构化画像,生成角色特定的引出提示,在第 16 层提取一个经评判器过滤的均值差方向,最后在 α∈{1.0,1.5,2.0,2.5} 上、针对 228 个与角色无关的问题评估生成的候选智能体。主要比较使用该 assistant 轴方向控制。控制不是尺度匹配的:其向量的平均 ℓ2 范数为 9.68,而角色特定向量为 3.79,因此相同系数并不意味着相同扰动幅度。

结果呈现的是异质性,而非均匀正向。在测试网格上,角色特定向量在评判所得的角色画像对齐度上高于 assistant 轴方向控制。对于大多数角色,对齐度随 α 增加而上升:每角色中位相关系数为 r=+0.98,74% 的角色在每一个连续步骤上都有改善。少数角色表现不同。38 个角色在所有六个测量维度上随 α 增加而下降,因此它们应被标记,而非在统一高强度设置下部署。这些角色中有许多在最低测试系数下已得分很高,所以问题在于系数选择,而非说明这些方向无用。我们将这一类别称为*在测试范围内不可控*。早期饱和和过度引导是合理的解释,但当前设计对机制仍保持开放。

测量结果的范围。在本文中,*角色画像对齐度*指与构建的角色描述及评估流水线使用的提示角色参考相一致的评判结果。它衡量的是候选合成智能体是否在测试问题和系数下表达出预期画像。第 6 节(https://arxiv.org/html/2608.00023#S6)阐述了相应的有效性边界和负责任使用约束。

##### 贡献。
- • 一个面向角色条件化智能体的部署前校准流水线。我们将结构化角色画像、对比激活提取、系数扫描和行为筛查结合成一个实用的工作流,用于为社交模拟准备合成智能体。
- • 跨 275 个角色的大规模刻画。在四个测试引导强度和 228 个与角色无关的问题集上,角色特定方向在评判所得的角色画像对齐度上优于 assistant 轴方向控制,且大多数角色在更强干预下表现出更高对齐度。
- • 对异构角色响应的失败感知描述。我们区分了可控、部分退化和不可控角色,并使用探索性几何多样性分析来解释(而非取代)行为筛查。

## 2 相关工作
LLM 社交模拟与智能体校准。基于 LLM 的模拟现已能够以先前难以实例化的规模建模交互式角色、智能体社会、集体行为以及文化或政治动态。核心方法论问题不是语言模型能否产生看似合理的交互轨迹,而是这些轨迹是否反映预期群体,而非提示伪影、泄漏、模型偏差或身份变异崩溃。这些关切使得校准、经验依据、可解释性和文档记录成为基于 LLM 的社交模拟的核心。现有的 persona 模拟审计显示了这些主题为何重要:提示表述会显著改变模拟的人口统计描绘(lutz_prompt_makes_2025),指令遵循和人格测量在多轮和不同评估设置下不稳定(li_measuring_controlling_2024;tosato_persistent_instability_2025),LLM 评判器在将其角色对齐度分数作为证据前需要显式校准(zheng_judging_llmasajudge_2023;zhou_personaeval_are_2025;lin_online_adaptive_2023;lin_online_policy_2024)。我们的工作解决的是一个上游校准问题:我们在候选角色条件化智能体被嵌入更大模拟之前,对其进行构建、引导和筛查。

Persona 建模。Persona 提示是实例化模拟智能体最常用的方式,但基于提示的控制在实践中可能产生脆弱结果。shanahan_roleplay_large_2023 将对话模型框架化为角色扮演系统,而 marks_persona_selection_2026 则认为后训练从更广泛的潜在 persona 分布中选择了一个默认 Assistant 后验。实证上,提示表述会改变模拟的人口统计描绘,指令遵循在多轮设置中衰减,即使是大模型的人格测量也不稳定(li_measuring_controlling_2024;chaudhari_peertopeer_learning_2025;lutz_prompt_makes_2025;tosato_persistent_instability_2025)。这些结果推动了对不那么依赖表面提示措辞的角色控制方法的研究。

激活引导与 persona 向量。激活引导通过在推理时将学习到的方向添加到模型激活中来改变行为(turner_steering_language_2024;panickssery_steering_llama_2024;zou2023repe)。例如,均值差引导在逐点 MSE 目标下具有形式化支持(im_unified_understanding_2025),但引导的可靠性取决于目标行为和系数选择(tan_analysing_generalisation_2024;lin_online_policy_2024;lin_online_adaptive_2023)。Persona 向量工作表明,内部方向可以监测或控制特质(chen2025persona)、扩展到大型角色清单并识别 Assistant Axis(lu2026assistant),以及在较小角色集合中改善角色特定行为(poterti_can_role_2025)。我们基于这些机制,而非提出新的引导估计器。在此背景下,我们的贡献是一个大规模、失败感知的工作流,用于构建和筛查候选角色智能体。

几何作为诊断工具。表示几何在这里是一个重要因素,因为模拟构建者通常需要可解释的失败信号,而非平均分数。线性表示假设和词向量算术促使将角色方向视为结构化对象(park_linear_representation_2024;mikolov_efficient_estimation_2013)。我们以次要角色使用几何:向量范数、参考距离、RSA、PCA 和特质投影为观察到的响应曲线提供探索性背景,并支持(而非取代)行为筛查。

## 3 预部署角色引导流水线
定义角色画像
提取候选方向
扫描四个 α 值
筛查对齐度和重复性
通过  记录配置
标记  修改、降低、提示或排除
部署  已筛查智能体
通过 标记
图 1:面向角色条件智能体的预部署校准工作流。一个结构化角色画像定义了候选行为目标;经评判器过滤的对比激活产生一个候选第 16 层方向;该方向在四个引导系数下进行评估;行为筛查要么保留一个已记录配置,要么将角色标记为低强度使用、画像修订、提示条件化或排除。该工作流输出已筛查的合成智能体供后续模拟使用;下游模拟验证仍是独立步骤。

我们的流水线将每个提取出的方向视为一个*候选*角色智能体配置,必须在模拟使用前进行评估。图 1(https://arxiv.org/html/2608.00023#S3.F1)总结了操作阶段:定义角色画像、提取候选方向、扫描引导系数、筛查结果行为,并通过或标记每个配置以供修订、低强度使用、提示条件化或排除。

模型与层。所有实验使用 OLMo-3-7B-Instruct(teamolmo2025olmo3),在第 16 层的残差流上操作,该层为最中间层,遵循角色引导工作中常见的中层约定(lu2026assistant)。

角色清单与引出。清单包含 275 个角色标签。许多条目对应职业,其他则是更广泛的原型或非职业角色;因此我们将该集合称为混合角色清单。对于每个角色,我们构建一个包含十五条行为指令的结构化画像(例如,核心驱动、决策风格、冲突立场、风险取向、内在矛盾;完整列表见附录 A.1(https://arxiv.org/html/2608.00023#A1.SS1)),并以角色描述、一组强制任务和一组角色情境为基础。从该画像中,我们生成五个系统提示和 50 个角色特定引出问题,涵盖七种情境类型(例如,资源冲突、模糊性响应、身份被剥夺;完整列表见附录 A.1(https://arxiv.org/html/2608.00023#A1.SS1))。画像和问题使用 moonshotai/kimi-k2.5:nitro 生成,当 O\*NET 职业与角色匹配时,以 O\*NET 职业数据库为种子。这些生成的画像是我们明确的建模假设,而非对某个职业人群的经验描述。问题探查的是画像所隐含的决策权衡,而非测试领域知识或表层风格模仿。生成细节见附录 A.1(https://arxiv.org/html/2608.00023#A1.SS1)。

经评判器过滤的向量提取。对于每个角色,我们收集在提示条件和默认(Assistant)条件下的响应,并用 LLM 评判器将每个响应评分为四个标签:完全角色扮演、部分角色扮演、任务响应式和非角色扮演。我们仅保留“完全角色扮演”的正例和“Assistant 风格”的负例,然后形成角色向量 v_r,作为过滤后配对上的第 16 层均值差——按照 im_unified_understanding_2025 的公式,这是最优逐点 MSE 估计器。

引导系数扫描。遵循 lu2026assistant,我们在与提取所用相同的层上进行引导,采用加法干预 h↦h+αv_r,其中 h 是该层的残差流激活,α∈{1.0,1.5,2.0,2.5}。这个网格提供了四种测试干预强度,因此本文中的系数-响应声明仅限于这些值。所报告的系数-响应筛查从 α=1.0 开始;单独的提示参考或无引导诊断不属于用于分类可控性的四点相关分析。我们分析 lu2026assistant 的 275 角色清单;“assistant”被视为第 275 个角色,同时也在附录 E.2(https://arxiv.org/html/2608.00023#A5.SS2)中作为一项探索性几何诊断的参考。确切的模型版本、解码设置和干预跨度细节,在可用情况下推迟到发布的配置工件中。

角色画像对齐度读数与筛查。对于每个(角色,α)单元,我们生成对 228 个与角色无关的对齐问题的响应,并使用 GPT-4.1-mini 沿六个维度进行评分:总体角色画像对齐度分数,以及情绪语域、词汇选择、社会动态、动机和世界观对齐度,对照提示角色参考。GPT-4.1-mini 生成提示参考并充当所有评判器,因此共享的模型先验可能同时影响目标和分数。筛查报告了对模拟使用至关重要的三个量:绝对角色画像对齐度、在四个测试系数上的响应,以及……

相似文章

超越静态人格:大型语言模型的情境人格引导

arXiv cs.CL

本文介绍了IRiS,一种无需训练的情境人格引导框架,它通过识别和利用情境依赖的人格神经元,超越了静态人格建模。该方法表明,大型语言模型的行为随情境变化,并提出了基于神经元的识别、检索和加权引导方法,在PersonalityBench和新增的SPBench基准上得到验证。

使用多智能体评估对角色扮演语言智能体进行对抗性压力测试

arXiv cs.AI

本文提出了一个模块化的多智能体平台,用于对角色扮演语言智能体进行对抗性压力测试,通过策略驱动的审讯智能体和自动化评判智能体,揭示多轮对话中累积的行为失败。跨三个人设和三类LLM家族的实验表明,多策略对抗评估将鲁棒性得分降低0.17-0.20,并识别出常见的失败模式,且与人类评判高度一致。

通过定向干预实现语言模型的多属性引导

arXiv cs.CL

MAT-Steer 提出了一种新颖的推理时干预框架,通过学习稀疏且正交的引导向量,选择性干预与每个属性相关的标记,从而在多属性冲突场景下引导大型语言模型,在问答任务和生成任务上的表现均优于现有方法。