为测试面试对话系统生成多样化的用户模拟器角色
摘要
本文提出了一种方法,利用大型语言模型自动生成多样化的用户角色,用于测试面试对话系统,以减少人工努力并增加模拟用户行为的多样性。
arXiv:2608.19549v1 公告类型:新
摘要:本文解决了测试面试对话系统所需大量劳动力的问题。尽管面试对话系统被期望在各种场景中有用,与其他对话系统类似,但使用人类用户进行测试需要大量精力和成本。因此,使用用户模拟器进行测试可能有益。由于大多数传统用户模拟器主要为训练任务导向对话系统而设计,对模拟用户的关注较少。在开发过程中,测试面试对话系统需要模拟广泛的用户行为,但手动创建大量用户角色是劳动密集型的。我们提出了一种方法,使用大型语言模型自动生成用户模拟器的用户角色。此外,通过在生成用户角色时分配与沟通风格相关的个性特征,我们旨在增加用户模拟器中沟通风格的多样性。实验结果表明,所提方法使用户模拟器能够生成更具多样性的语句。
查看缓存全文
缓存时间: 2026/08/21 10:06
# 为测试面试对话系统而生成多样化用户模拟器人格 来源:https://arxiv.org/html/2608.19549 Mikio Nakano 所属单位:C4A Research Institute, Inc., 日本东京世田谷区;所属单位:SANKEN, 大阪大学, 日本大阪府茨木市 Hironori Takeuchi 所属单位:武藏大学, 日本东京练马区 [email protected], [email protected] [email protected] ###### 摘要 本文探讨了测试面试对话系统所需投入大量人力的问题。虽然面试对话系统有望在各种场景中发挥作用,但与其他对话系统类似,使用真实用户进行测试需要付出巨大的努力和成本。因此,使用用户模拟器进行测试是有益的。由于大多数传统的用户模拟器主要为训练任务型对话系统而设计,模拟用户的人格很少受到关注。在开发过程中,测试面试对话系统需要模拟广泛的用户行为,但手动创建大量人格是劳动密集型的。我们提出了一种使用大语言模型为用户模拟器自动生成人格的方法。此外,通过在生成人格时分配与沟通风格相关的人格特质,我们旨在增加用户模拟器中沟通风格的多样性。实验结果表明,所提出的方法使用户模拟器能够生成更具多样性的语句。 ## 1 引言 面试对话系统能够高效地从众多用户那里收集信息,是对话系统技术的一个有前景的应用,近年来吸引了越来越多的研究兴趣。然而,构建对话系统(包括面试对话系统)需要付出巨大的成本。一个主要的成本是测试所需付出的努力。我们研究的目标是减轻测试面试对话系统的手工劳动。 为了降低测试成本,可以使用**用户模拟**来替代人工测试。然而,现有的用户模拟器主要为任务型对话系统的训练和评估而开发。因此,我们旨在开发一个对测试面试对话系统有用的模拟器。 在测试面试对话系统时,模拟各种各样的用户至关重要。为了增加变化性,拥有大量的**用户人格**是有益的。然而,手动创建大量人格是劳动密集型的。虽然有人考虑过使用大量预构建人格集的方法,但对于需要人格与特定面试主题对齐的面试对话来说,这种方法并不适用。 因此,本文提出了一种使用**大语言模型**生成多样化人格的方法。在该方法中,提供少量手动创建的人格作为示例,并让LLM负责生成大量额外的人格。为了确保说话风格和对系统态度的多样性,在生成过程中指定了人格特质。 评估实验证明,所提出的方法能够通过生成大量人格来创建多样化的对话。这增加了发现系统问题的可能性。请注意,从模拟对话中检测系统问题超出了本研究的范围。人工检查是一种可能的方法,但使用LLM的自动化方法也是可行的。 本研究的贡献如下: - 我们讨论了用于测试面试对话系统的用户模拟器需要多样化的人格。 - 我们提出了一种使用LLM生成多样化人格的方法。 - 我们引入了一种通过指定与沟通风格相关的人格特质来增强人格多样性的技术。 - 通过评估实验,我们证明了所提出的人格生成方法能够创建多样化的对话。 ## 2 相关工作 ### 2.1 面试对话系统 通过自然语言交互从人类身上提取信息的面试对话系统,因其较高的实用价值而受到了广泛关注。应用领域示例包括:大学课程评价调查、电话调查、心理健康评估、饮食摄入记录、工作面试、饮食偏好调查、护士职业咨询、衰弱诊断、收集人们对机器人未来的看法、促进用户评论撰写以及客户访谈等。我们提出了一种有效测试此类面试对话系统的方法。 ### 2.2 测试对话系统 如前所述,测试对话系统需要付出巨大努力,各种方法和工具已被提出来促进这一过程。例如,有工具使用语料库验证对话系统是否按预期行为,还有方法使用预定义的测试用例来测试系统。由于这些测试方法需要提前准备测试用例,因此它们对于检测预期范围内的问题很有效。然而,在与多样化用户的交互中,可能会出现意想不到的问题,因此需要能够检测此类未预见问题的方法。 ### 2.3 对话系统的用户模拟 因此,我们使用用户模拟器。对话系统的用户模拟器传统上用于评估对话策略。然而,随着对话策略统计建模的进步,研究越来越关注使用强化学习训练对话策略模型。 近年来,随着大语言模型的发展,基于LLM的用户模拟器已被提出。 在任务型对话系统用户模拟器的研究中,已使用诸如与人类用户行为的相似性以及学习到的对话策略质量等评估指标。 我们的研究与这些先前研究的不同之处在于,它提出了一种专门为测试面试对话系统构建用户模拟器的方法。也需要不同的评估指标。 ### 2.4 在用户模拟中使用人格 在用户模拟器中使用人格的研究也已展开。已有研究表明,通过为老年和年轻用户准备模拟器,可以学习到不同的对话策略。有研究在护理管理员的监督下,手动为用于评估护士职业咨询对话系统的用户模拟器创建了护士人格。我们的研究与这些研究的不同之处在于我们自动生成人格。 ### 2.5 人格生成 至于自动人格生成的研究,有一些方法从Reddit中提取人格。它们收集表达人格的句子(例如,包含“I”或“my”的句子)并用于人格创建。也有人提出使用LLM生成人格的方法。有研究提出了一种使用LLM从文本生成代表人格的段落的方法。然而,使用这些方法很难生成适合面试对话系统领域的受访者人格。 ## 3 提出的方法 在提出的方法中,我们使用LLM生成模拟用户人格。需要确保生成的人格包含与目标面试对话系统领域相关的信息。为实现这一点,我们使用少量手动编写的人格(此后称为**种子人格**)作为少样本示例进行上下文学习。此外,为了通过引入更大的用户语句变化性来促进发现潜在问题,在生成人格时向LLM提供定义沟通风格的人格特质。通过将生成的人格和人格特质嵌入到基于LLM的用户模拟器的提示中,我们可以生成多样化的对话。图1说明了所提出的方法。 图1:所提出方法概览。我们使用以下两个维度作为人格特质: #### 拟人化程度 一个维度涉及用户是将系统视为物体还是人类。将系统视为物体的用户旨在高效地使用对话系统,倾向于使用易于系统理解的表达方式。相反,将系统视为人类的用户与系统交谈时就像与人交谈,不考虑系统是否能理解他们。这种行为可以解释为用户将系统拟人化。我们称这个维度为拟人化程度。 #### 详述程度 另一个维度涉及用户是进行冗余沟通还是直接沟通。有研究将用户的沟通风格分为详述和直接。我们研究中采用了相同的分类。 - 用户是否经常旅行 - 用户最近去过的地方 - 用户过去旅行目的地中最喜欢的地方 - 用户旅行时喜欢做的活动 - 不常旅行的原因(如适用) - 用户接下来想去的地方 - 用户如何预订旅行(例如,访问旅行社、致电旅行社、使用网站) 图2:旅行面试对话系统向用户询问的主题。 ``` - 姓名:町山理佐子 - 49岁 - 女性 - 居住在东京 - 与丈夫和两个女儿同住(一个高三女儿和一个初三女儿) - 在办公室做兼职 - 说话欢快,语速快,话语多 - 大约一年旅行一次 - 最近和家人去了台湾 - 旅行时喜欢购物 - 想去洛杉矶 - 通常通过访问旅行社预订旅行 ``` ``` - 姓名:山中雄马 - 32岁 - 男性 - 居住在北海道 - 独自居住 - 厨师 - 说话清晰,经常谈论自己 - 大约一年旅行一次 - 最近独自去了大阪 - 旅行时喜欢美食之旅,以获取专业灵感 - 想去新加坡 - 通常在线预订旅行 ``` 图3:旅行面试对话系统的种子人格示例。 ``` # 任务 - 为接受关于旅行经历和理想旅行目的地调查的受访者创建25个人格,并按照示例中的JSON格式生成。 - 尽可能确保人格之间有差异。 - 受访者具有以下人格特质;创建与这些特质一致的人格。 - 不要重复使用示例中的任何人格。 # 人格特质 {personality} # 示例 {examples} ``` 图4:用于人格生成的提示模板。{personality} 替换为人格特质的描述,{examples} 替换为转换为JSON格式的种子人格。在noPT条件下,使用不包含人格特质描述的模板。 APM:高 ``` - 将系统视为人类而非物体 - 像与人交谈一样与系统交谈 - 试图测试系统,突然改变话题或长篇大论 ``` APM:低 ``` - 将系统视为物体而非人类 - 意识到系统理解的局限性,尽可能简单地说话 - 对系统表现出合作态度 ``` 图5:在人格生成提示中使用的、通过改变拟人化程度得到的人格特质描述。 EL:高 ``` - 说话冗余 - 谈论未明确询问的事情 - 有时使用间接表达 ``` EL:低 ``` - 说话直接 - 说话简洁 - 不谈论未被问及的话题 ``` 图6:在人格生成提示中使用的、通过改变详述程度得到的人格特质描述。尽管大五人格特质是众所周知的,但我们没有使用它们,因为我们认为直接指定用户的说话风格对我们的目的更有效。 ## 4 评估 我们进行了一项评估实验,以研究所提出的方法对于测试面试对话系统是否有效。请注意,本实验仅涉及日语系统,后续所有图表均从日语翻译而来。 ### 4.1 比较方法 我们比较了以下五种条件: #### BL (基线):仅使用种子人格,不生成新的人格。 #### noPT (无人格特质):提出的方法中不包含关于两种人格特质的提示。生成人格时仅提供种子人格。 #### APM (拟人化):提出的方法中,将拟人化程度作为生成人格的人格特质给出。程度为高或低。 #### EL (详述程度):提出的方法中,将详述程度作为生成人格的人格特质给出。程度为高或低。 #### APM+EL 提出的方法中,将拟人化程度和详述程度都作为生成人格的人格特质给出。
相似文章
超越合作模拟器:为LLM代理的稳健评估生成逼真的用户角色
提出了Persona Policies(PPol),一种即插即用的控制层,利用LLM驱动的进化程序搜索来生成多样且逼真的用户角色,用于评估LLM代理。相比基线实现了33-62%的适应度提升,逼真度评分达到80.4%,并将代理鲁棒性提升了+17%的任务成功率。
动态内群体人格生成以增强人机融洽关系
本文介绍了一种基于LLM的聊天机器人动态生成内群体人格的方法:首先识别用户的主要关切,然后创建一个共享该关切点的合成人格。一项人类受试者研究表明,与基线条件相比,该方法在感知融洽度和用户参与度方面有显著提升。
PersonaArena:用于评估和增强大语言模型中人格层面角色扮演的动态模拟框架
PersonaArena 是一个动态模拟框架,利用大规模社交内容语料库和多智能体辩论评判机制,评估并提升大语言模型在真实社交场景中保持连贯且真实的人格层面角色扮演能力。
对话推荐系统中用户模拟的提示优化:一个多目标框架
本文提出了一种框架,用于自动优化基于LLM的对话推荐系统用户模拟器的提示,解决了正向偏差和行为多样性有限等问题。
PersonaKit (PK):用于在全双工对话中测试多样化角色的即插即用平台
PersonaKit 是一个开源 Web 平台,旨在对全双工对话系统中的多样化角色进行快速原型设计和用户测试。它允许研究人员通过 JSON 配置角色特有的轮流对话行为,并进行 A/B 测试以评估社会语言学交互。