超越合作模拟器:为LLM代理的稳健评估生成逼真的用户角色

arXiv cs.AI 论文

摘要

提出了Persona Policies(PPol),一种即插即用的控制层,利用LLM驱动的进化程序搜索来生成多样且逼真的用户角色,用于评估LLM代理。相比基线实现了33-62%的适应度提升,逼真度评分达到80.4%,并将代理鲁棒性提升了+17%的任务成功率。

arXiv:2605.12894v1 Announce Type: new 摘要:大语言模型(LLM)代理越来越多地被部署在与各种人群交互的场景中,包括那些表述不清、缺乏耐心或不愿分享信息的用户。然而,大规模收集真实交互数据仍然昂贵。该领域已转向基于LLM的用户模拟器作为替代,但这些模拟器继承了其底层模型的行为:合作且同质。因此,在模拟中表现强势的代理往往在面对真实用户多样且未曾见过的沟通模式时失败。为缩小这一差距,我们引入了Persona Policies(PPol),一种即插即用的控制层,在为用户模拟器引入真实行为变异的同时保留原始任务目标。我们不是手动设计角色,而是将角色生成视为LLM驱动的进化程序搜索,优化一个Python生成器来发现行为并将其转化为保留任务的角色扮演策略。候选生成器由多目标适应度评分引导,该评分结合了逼真度与对人类行为模式的广泛覆盖。优化后,生成器为领域内任何任务生成多样且逼真的用户角色群体。在tau^2-bench零售和航空领域,进化的PPol程序在适应度评分上相比基线模拟器取得了33-62%的绝对提升。在盲评中,标注员将PPol条件下的用户判定为人类的概率为80.4%,接近真实人类轨迹,且频率几乎是基线模拟器的两倍。使用PPol训练的代理对具有挑战性的分布外行为更加鲁棒,任务成功率相比仅在现有模拟交互上训练提升了+17%。这提供了一种新颖的方法,在不改变任务或奖励的情况下加强基于模拟器的评估和训练。
查看原文
查看缓存全文

缓存时间: 2026/05/14 06:14

# 超越协作模拟器:为LLM智能体的稳健评估生成逼真的用户画像

来源:https://arxiv.org/html/2605.12894

Harshita Chopra†,α  Kshitish Ghate†,α  Aylin Caliskanα  Tadayoshi Kohnoβ  Chirag Shahα  Natasha Jaquesα

α华盛顿大学,西雅图,WA
β乔治城大学,华盛顿特区

Persona-Policies (https://github.com/harshita-chopra/persona-policies)

###### 摘要

大型语言模型(LLM)智能体越来越多地被部署在与各种人群交互的场景中,包括那些不清晰、不耐烦或不愿分享信息的用户。然而,大规模收集真实的交互数据仍然成本高昂。该领域已转向基于LLM的*用户模拟器*作为替代,但这些模拟器继承了其底层模型的行为:协作且同质化。因此,在模拟中表现良好的智能体,在面对真实用户复杂多变的沟通模式时常常失败。为了缩小这一差距,我们引入了**Persona Policies**(PPol),这是一个即插即用的控制层,它能在保留原始任务目标的同时,为用户模拟器引入真实的行为变化。我们不采用手工制作画像的方式,而是将画像生成视为一个由LLM驱动的进化程序搜索过程,该过程优化一个Python生成器来发现行为,并将其转化为保留任务的角色扮演策略。候选生成器由一个多目标适应度分数引导,该分数结合了类人性和对人类行为模式的广泛覆盖。优化后的生成器可以为该领域内的任何任务生成多样化的类人画像群体。在τ²-bench的零售和航空领域中,经过进化的PPol程序在适应度分数上比基线模拟器绝对提升了33-62%。在一项盲评中,标注者将PPol条件化的用户识别为人类的概率为80.4%,接近真实人类轨迹,并且几乎是基线模拟器的两倍。使用PPol训练的智能体对具有挑战性的、分布外的行为更加鲁棒,与仅在现有模拟交互上训练相比,任务成功率绝对提升了+17%。这为在不改变任务或奖励的情况下,加强基于模拟器的评估和训练提供了一种新颖的方法。

## 1 引言

基于LLM的助手的潜力在于它们能够作为自主智能体,处理复杂的多轮任务,如提供技术支持或进行预订。然而,要真正有用,智能体必须做的不仅仅是导航软件界面;它还必须应对人类沟通的不可预测性。真实用户很少能完美地提供信息 (Herlihy et al., 2024; Naous et al., 2025)。他们有着不同的偏好、不同的耐心程度,并且常常通过模糊、碎片化甚至有时是对抗性的语言来表达自己的需求 (Keyvan and Huang, 2022)。为了值得信赖,智能体必须充分推断意图,适应个体风格,并确保在没有明确共识的情况下不采取任何不可撤销的行动。构建具有这种社会和程序鲁棒性的智能体,需要能够复制真实世界服务交互中摩擦的评估环境。

因此,该领域转向了基于模拟的基准测试,将智能体与“用户模拟器”配对:这些LLM被提示充当具有固定目标的用户或客户,涉及零售、银行和航空等领域 (Barres et al., 2025)。然而,最近的研究表明,这些默认的用户模拟器过于协作、完美一致、且非常乐于提供信息 (Dou et al., 2025)。真实用户通常会保留细节直到被提示,会对错误假设提出异议,使用模糊的语言,并在耐心和协作程度上有所不同。这就造成了一个*行为差距*:智能体在面对协作模拟器时可能表现强劲,但在面对真实人类用户的沮丧、怀疑或简洁时却会失败 (Zhou et al., 2026)。

![参见图注](图1:Persona Policies (PPol) 程序进化循环概览。对于给定任务,程序 G 生成 N 个画像策略,这些策略在模拟用户的沟通方式上有所不同。候选程序通过任务 rollout 进行评分,评估其类人性和行为覆盖率,同时反思反馈判断轨迹质量以引导对轴、采样规则和提示的改进。一旦优化,该生成器可以为该领域的新任务生成多样化的画像策略。)

近期的研究表明,使用手工指定的特征(如不耐烦或怀疑)来引导模拟器 (He et al., 2025; Shim et al., 2026) 会创建一个有价值的压力测试,从而降低智能体的成功率。然而,尽管“更丰富的合成用户”会影响性能,但它们通常是手工指定的或从固定的、手工设计中采样的,而不是基于真实人类行为的实际复杂分布。

为了解决这个问题,我们引入了**Persona Policies** (PPol),这是一个即插即用的控制层,通过在保持基准任务不变的情况下生成多个类人画像,使用户模拟多样化。每个‘*策略*’是一组简短的*额外*指令,添加到模拟器提示中,控制用户*如何*沟通,例如通过改变语气、节奏、选择性披露等。这使得相同的任务可以在多种现实的沟通模式下进行测试,从而使基准性能更能反映对真实用户的鲁棒性,而不是在一种协作模拟器风格上的成功。

学习这些策略被框架化为*进化程序搜索*。我们不是手工制作提示,而是实现一个Python画像生成器,该生成器生成一组行为配置文件,并将每个配置文件扩展为保留任务的角色扮演指令。使用OpenEvolve (Sharma, 2025),一个前沿LLM迭代地变异生成器的代码。我们通过实际的智能体-用户 rollout 来评估候选生成器,根据两个目标对画像进行评分:**类人性**,由训练好的判别器分类为人类的概率衡量,以及**行为覆盖率**,衡量 N 个画像在多大程度上覆盖了人类分布。这两个指标都使用*行为指纹*计算,该指纹包含19个词汇和交互层面的特征,涵盖沟通风格、信息披露、澄清行为和错误反应 (Zhou et al., 2026)。基于这些目标的MAP-Elites档案 (Mouret and Clune, 2015) 保持了群体的多样性,而不是收敛到单一的行为类型。

除了评估之外,进化的画像还提供了强大的训练信号。在这些多样化交互上微调的智能体提高了下游鲁棒性,这表明画像增强模拟可以作为语言智能体的域随机化 (Tobin et al., 2017)。在这项工作中,我们做出了三项贡献:
1.  我们设计了PPol作为一个即插即用的控制层,在不改变底层任务的情况下,为标准用户模拟器注入真实的行为多样性。
2.  我们将画像制定为一个自动化框架,使用进化搜索来发现多样化的、类人的行为,无需手动干预。
3.  我们端到端地验证了PPol:进化的画像缩小了模拟器与人类之间的差距,在盲评中显得类人,并且在用于训练时提高了智能体的鲁棒性。

## 2 相关工作

#### 用于交互式智能体的用户模拟。
最近的智能体基准越来越多地在多轮、工具介导的环境中进行评估,而不是静态提示。MINT 强调了迭代工具使用和自然语言反馈 (Wang et al., 2024);τ-bench 形式化了策略约束的客户服务交互,具有可验证的最终状态奖励;τ²-bench 将其扩展到双重控制设置,用户也在共享环境中行动 (Barres et al., 2025);ToolSandbox 增加了有状态工具和策略内对话 rollout (Lu et al., 2025)。类似地,最近的一项研究表明,即使强大的模型在信息跨轮次逐步揭示时也会变得非常不可靠,突显了多轮辅助任务中固有的挑战 (Laban et al., 2026)。

#### 画像与行为控制。
先前关于用户模拟的工作主要集中在使模拟交互更加连贯、自然或与目标一致。基于LLM的模拟器通过微调真实对话、添加验证器模型或学习更类人的提问模式来改进任务导向的对话 (Sekulic et al., 2024; Luo et al., 2024; Kong et al., 2024)。另一个平行的基于画像的工作使用配置文件来多样化生成的用户和响应,从基于配置文件的对话 (Zhang et al., 2018) 到从人机对话中推断出的隐式用户画像 (Wang et al., 2025) 以及大规模画像驱动的合成数据生成 (Ge et al., 2024)。这些方法使模拟用户不那么通用,但它们通常将画像视为固定的描述、采样的配置文件或训练数据工件。最近的工作 (Paglieri et al., 2026) 引入了一种方法来自动进化画像生成器以最大化群体覆盖率。然而,他们的重点是静态偏好响应和通用场景的多样性,而不是任务基础的交互。我们将这种可扩展画像生成的概念扩展到多轮智能体评估:给定一个固定任务,PPol 生成一个用户群体,所有这些用户追求相同的目标但以不同的方式进行沟通。生成器通过智能体-用户 rollout 针对两个属性进行优化:产生的对话是否类似于真实的人类交互,以及生成的群体是否覆盖了人类行为分布的不同区域。

#### 多样化用户下的鲁棒性。
交互式基准测试的评估分数反映了*同时*反映智能体和对话的模拟用户。最近的元评估表明,切换模拟器可以重新排序模型排名,并与人类判断产生分歧 (Dou et al., 2025; Seshadri et al., 2026; Zhou et al., 2026)。另外,压力测试研究表明,对用户行为进行微小的、受控的更改,例如提示更不耐烦或更不合作的玩法,可以使头条成功率发生很大的变化 (He et al., 2025; Shim et al., 2026)。总之,这些发现表明,应该将模拟用户作为基准测试中一个明确的、可调的部分,而不是隐藏在评估中的默认设置。为此,PPol 框架发现了用户端的交互行为,并将选择建立在从真实人类轨迹中计算的信号之上。

## 3 方法

Persona Policies (PPol) 自动化创建了一个领域级别的程序,该程序可以为任何给定的用户场景生成多个保留任务的画像。我们首先说明设置和符号,然后描述生成器、适应度分数、进化搜索和实现。

### 3.1 问题设置

我们考虑多轮、目标导向的对话基准测试。每个任务 t 指定一个场景和用户的目标。令 c_t 为基准测试提供给现有用户模拟器的用户上下文:基本画像、任务指令以及用户可用的任何事实。我们按原样将此上下文传递给画像生成器。一个 LLM *用户模拟器* 被提示任务并与一个*智能体*对话。所有任务级别的量都是固定的:目标、私有事实、环境状态以及由任务完成规则确定的成功。唯一的可控输入是附加到用户模拟器*系统*提示的自然语言文本。

![参见图注](图2:示例 (A) 发现的行为轴 (驱动群体多样性), (B) 由PPol生成的画像, (C) 对一个小批量进行反思 (作为反馈来变异程序).)

画像策略 P_π 指附加的自然语言文本。它控制模拟用户的沟通风格,包括语气、节奏和披露,同时保留 s_base(t) 中提供的目标和私有知识,s_base(t) 是任务 t 的基准默认系统提示。用户端的系统提示变为 s_base(t) ⊕ P_π,其中 ⊕ 表示字符串拼接。行为变化由一个行为轴列表 D 表示。每个条目命名一个轴,给出一个简短定义,并提供配对的开启/关闭*剧本*,说明行为在激活或不激活时如何表现。参见图2(A) 示例。我们用四个行为进行种子初始化:简洁、怀疑、沮丧和模糊。列表 D 保存在可进化的生成器源文件中,因此变异除了指令之外,还可以添加、删除或细化轴。

在高层次上,该过程有四个步骤:为每个基准任务生成一组画像策略,运行智能体-用户交互 rollout,根据人类参考行为对生成的轨迹进行评分,并使用进化编码智能体来变异生成器源代码。

### 3.2 画像生成

可进化的工件是一个 Python 程序,它实现了画像生成器函数 G 并持有当前轴列表 D。对于任务 t,生成的画像策略集是 Π_t = {P_{π,t}^{(i)}}_{i=1}^{N}, Π_t = G(c_t, D, N)。 (1)

每个画像策略 P_{π,t}^{(i)} 有一个画像记录 r_t^{(i)} = (a_t^{(i)}, P_{π,t}^{(i)}), a_t^{(i)} ∈ {0,1}^{|D|}。

这里 a_t^{(i)}: D → {0,1} 是二元映射,它决定了哪些行为轴(例如 *分心*)对于任务 t 上的画像 i 是激活的(true)。

#### 群体生成。
**第一阶段**是*群体生成*:一个前沿语言模型,以场景 c_t 和 D 的完整规范为条件,联合提出 N 个*群体成员*。结构化响应恰好列出 N 个成员,每个成员都带有简短的自然语言摘要、简要理由以及 {0,1}^{|D|} 中的轴分配。因为分配是联合选择的,所以在编写任何长篇的用户端策略之前,这一阶段就驱动了离散行为空间中的**多样性**。

#### 画像扩展。
**第二阶段**独立并行地将每个群体成员*扩展*为一个长篇的自然语言画像策略 P_{π,t}^{(i)}。

相似文章