面向任务对话的人格引导LLM代理

arXiv cs.CL 论文

摘要

本文探讨了在面向任务对话中,LLMs如何作为人格引导的代理,并通过GPT-4o和Gemini 2.0 Flash等模型评估,分析了人格适应对任务性能和用户满意度的影响。

arXiv:2608.18085v1 公告类型:新 摘要:先前的工作表明,大语言模型(LLMs)可以在开放式文本生成中表达多样化的人格特质。然而,尚不清楚它们是否能在目标导向的对话中做到这一点而不影响任务完成,以及适应用户人格是否能提高交互质量。我们在面向任务对话(TOD)中研究这些问题,其中系统通过多轮交互帮助用户完成目标。我们构建了一个无需训练的框架,模拟了两个LLMs之间的TOD交互:一个展示目标人格的用户代理和一个适应用户人格同时完成任务的系统代理。为了隔离适应的影响,我们改变了系统对用户人格的了解程度,设置三种条件:在Neutral中,系统不接收任何人格信息;在Try中,它从对话线索推断人格;在Oracle中,它被明确告知人格。我们在Schema-Guided Dialogue (SGD)数据集中的酒店和餐厅对话上评估了GPT-4o、Qwen3-Next-80B和Gemini 2.0 Flash,涵盖Big Five人格特质及其对立面。我们发现,用户代理可以在保持系统强大任务性能的同时表达人格,尽管某些特质的实现远不如其他可靠。适应用户人格提高了约束满足度、信息率和用户满意度,但降低了真实性,揭示了个性化和任务基础之间的权衡。Oracle的收益在目标特质被强烈表达时增长,而Try的收益对实现强度基本不敏感。总的来说,Try中的基于线索的适应最好地解决了这种权衡,并提供了无需微调的、更可靠的人格感知TOD路径。
查看原文
查看缓存全文

缓存时间: 2026/08/20 09:51

# 人格引导的大语言模型代理:面向任务导向对话
来源:https://arxiv.org/html/2608.18085  
Maryam Shoaeinaeini, Brent Harrison, A\.B\. Siddique  
肯塔基大学 莱克星顿,肯塔基州,美国  
\{maryam\.shoaei, brent\.harrison, ab\.siddique\}@uky\.edu

###### 摘要

先前研究表明,大语言模型(LLMs)在开放式文本生成中能展现多样的人格特质。然而,尚不清楚它们在目标导向的对话中能否做到这一点而不影响任务完成,以及适应用户的人格是否能提升交互质量。我们在任务导向对话(TOD)中研究了这些问题,其中系统通过多轮交互帮助用户达成目标。我们构建了一个无需训练的框架,模拟两个LLM之间的TOD交互:一个用户代理展现目标人格,一个系统代理在完成任务的同时适应用户。为隔离适应效应,我们通过三种条件变化系统对用户人格的了解程度:在“中立”(Neutral)条件下,系统不接收任何人格信息;在“尝试”(Try)条件下,系统从对话线索中推断人格;在“神谕”(Oracle)条件下,系统被明确告知人格。我们在Schema引导对话(SGD)数据集的酒店和餐厅对话中,针对大五人格特质及其对立面,评估了GPT-4o、Qwen3-Next-80B和Gemini 2\.0 Flash。我们发现,用户代理可以在系统保持强大任务性能的同时表达人格,尽管某些特质的实现可靠性远低于其他特质。适应用户人格提升了约束满足率、信息提供率和用户满意度,但降低了真实性,揭示了个性化与任务基线之间的权衡。“神谕”条件下的增益在目标特质强烈表达时增加,而“尝试”条件下的增益对实现强度基本不敏感。总体而言,“尝试”条件下的基于线索的适应最能解决这一权衡,为无需微调的人格感知TOD提供了一条更可靠的途径。111代码和生成的对话将在论文接受后发布。

人格引导的大语言模型代理:面向任务导向对话

Maryam Shoaeinaeini, Brent Harrison, A\.B\. Siddique  
肯塔基大学 莱克星顿,肯塔基州,美国  
\{maryam\.shoaei, brent\.harrison, ab\.siddique\}@uky\.edu

## 1引言

大语言模型越来越多地被用作交互质量与最终答案正确性同样重要的场景下的助手。在这样的场景中,用户不仅希望系统完成任务;他们还希望系统以恰当、响应及时且与个人协调的方式进行沟通。这使得个性化成为对话代理的核心目标,特别是在客户支持、预订和助手场景中,交互风格可以塑造用户的信任和满意度Parket al\.\(2023 (https://arxiv.org/html/2608.18085#bib.bib6)\); Wanget al\.\(2024 (https://arxiv.org/html/2608.18085#bib.bib5)\)\。

先前研究表明,LLMs可以在开放式文本生成中表达多样化的人格特质。LLMs可以在问卷、叙事、角色扮演和受控生成任务中模仿可识别的人格模式Liet al\.\(2022 (https://arxiv.org/html/2608.18085#bib.bib8)\); Pan and Zeng \(2023 (https://arxiv.org/html/2608.18085#bib.bib9)\); Serapio\-Garcíaet al\.\(2023 (https://arxiv.org/html/2608.18085#bib.bib10)\); Jianget al\.\(2022 (https://arxiv.org/html/2608.18085#bib.bib11),2024 (https://arxiv.org/html/2608.18085#bib.bib19)\); Maoet al\.\(2023 (https://arxiv.org/html/2608.18085#bib.bib12)\)\。这些研究暗示LLMs能展现可测量的大五人格特质Goldberg \(2013 (https://arxiv.org/html/2608.18085#bib.bib16)\)并在生成文本中保持人格一致的模式。然而,大多数现有评估是在目标导向对话之外研究人格表达。因此,尚不清楚LLMs在追求具体任务时能否表达人格,以及适应用户人格是否真正提升交互质量。

这个问题在任务导向对话(TOD)中尤为重要,其中系统通过多轮交互帮助用户达成目标。与开放式对话不同,TOD系统必须满足模式约束、收集所需的槽值、发出有效的API调用并完成用户的任务Rastogiet al\.\(2020 (https://arxiv.org/html/2608.18085#bib.bib13)\); Zanget al\.\(2020 (https://arxiv.org/html/2608.18085#bib.bib2)\); Mosharrofet al\.\(2025 (https://arxiv.org/html/2608.18085#bib.bib7)\)\。人格感知行为可能通过使系统更能响应用户的沟通风格、不确定性或偏好来改善交互。同时,它也可能带来风险:过度适应人格线索可能降低基线一致性、扭曲建议或干扰任务完成。因此,人格感知的TOD需要在个性化与任务基线行为之间取得平衡。

受此差距驱动,我们研究三个研究问题:RQ1:LLMs能否在无需微调的情况下,生成同时表达人格并满足模式约束的连贯任务导向对话?RQ2:人格访问如何影响系统质量和成对用户满意度?RQ3:用户特质实现强度如何影响人格调节带来的满意度增益,以及这种关系在显式(神谕)和隐式(尝试)调节之间是否存在差异?为回答这些问题,我们构建了一个无需训练的框架,用于测试人格适应如何影响模式引导任务导向对话中的LLM代理。我们比较三种系统条件:“中立”,系统不接收任何人格信息;“尝试”,系统必须从对话线索中推断用户人格;“神谕”,系统被明确告知用户的目标特质。此设计在固定领域结构、模式和任务要求的同时,隔离了人格访问的影响。我们通过生成Schema引导对话(SGD)数据集Rastogiet al\.\(2020 (https://arxiv.org/html/2608.18085#bib.bib13)\)中的酒店和餐厅对话来评估GPT-4o、Qwen3-Next-80B和Gemini 2\.0 Flash,涵盖大五人格特质及其对立面。我们从四个维度评估生成的对话:任务结果、人格实现、系统质量和成对用户满意度。图1 (https://arxiv.org/html/2608.18085#S1.F1)总结了整体框架。

参见图注  
图1:我们的个性化感知任务导向对话框架概览。人格调节的用户代理在三种人格访问条件——“中立”、“尝试”和“神谕”——下,在基于SGD的API基线任务设置中与系统代理交互。生成的对话针对任务结果、系统质量和人格相关行为进行评估。  
我们的研究发现回答了三个研究问题。对于RQ1,基于LLM的用户代理可以在模式引导的对话中表达人格,同时系统保持强大的任务性能,尽管某些特质的实现可靠性远低于其他特质。关于RQ2,适应用户人格提升了约束满足率、信息提供率和成对用户满意度,但降低了真实性,揭示了个性化与基线一致性之间的权衡。对于RQ3,“神谕”条件下的增益在目标特质强烈表达时增加,而“尝试”条件下的增益对实现强度基本不敏感。总体而言,“尝试”设置下的基于线索的适应为无需微调的人格感知TOD提供了一条更可靠的途径。

## 2相关工作

### 2\.1基于LLM的任务导向对话

任务导向对话(TOD)研究传统上侧重于跟踪对话状态、填充槽位、预测系统动作,并在结构化API或知识源中基线响应的系统。该领域的进展很大程度上依赖于高质量的标注数据集,如MultiWOZ和模式引导对话(SGD),这些数据集支持跨领域的基准测试,但也凸显了人工标注的成本和脆弱性Ericet al\.\(2020 (https://arxiv.org/html/2608.18085#bib.bib3)\); Zanget al\.\(2020 (https://arxiv.org/html/2608.18085#bib.bib2)\); Hanet al\.\(2021 (https://arxiv.org/html/2608.18085#bib.bib4)\); Rastogiet al\.\(2020 (https://arxiv.org/html/2608.18085#bib.bib13)\)\。基准测试,如模式遵循、状态跟踪和用户目标完成,这些形式化了TOD系统核心要求的标准,即使在生成器是LLM时仍然是核心。

最近的工作越来越多地用基于LLM的方法取代完全监督的管道,这些方法使用上下文学习或减少标注,更有效地泛化到新领域Mosharrofet al\.\(2025 (https://arxiv.org/html/2608.18085#bib.bib7)\)\。这种转变提高了灵活性,但主要焦点仍然是任务成功、槽位准确性和领域转移下的鲁棒性,而不是针对用户的特定适应。因此,先前的TOD工作为结构化交互提供了坚实的基础,但在模式约束设置下,人格线索如何改变任务完成、基线一致性和用户满意度仍然悬而未决。

### 2\.2LLM中的人格和人设控制

另一条研究线研究大语言模型能否表达稳定的人格特质或人设。先前的研究通过问卷式探测、叙事生成和受控提示评估人格信号,表明LLMs可以模仿可识别的特质模式,并在人格维度上展现可测量的差异Liet al\.\(2022 (https://arxiv.org/html/2608.18085#bib.bib8)\); Pan and Zeng \(2023 (https://arxiv.org/html/2608.18085#bib.bib9)\); Serapio\-Garcíaet al\.\(2023 (https://arxiv.org/html/2608.18085#bib.bib10)\); Jianget al\.\(2022 (https://arxiv.org/html/2608.18085#bib.bib11),2024 (https://arxiv.org/html/2608.18085#bib.bib19)\)\。关于角色扮演和代理模拟的相关工作进一步表明,LLMs可以在较长的交互中维持社会角色和行为框架Wanget al\.\(2024 (https://arxiv.org/html/2608.18085#bib.bib5)\); Parket al\.\(2023 (https://arxiv.org/html/2608.18085#bib.bib6)\)\。

其他研究从测量人格转向主动诱导或编辑它,例如通过提示设计、人设调节或模型级控制机制Maoet al\.\(2023 (https://arxiv.org/html/2608.18085#bib.bib12)\); Lotfiet al\.\(2023 (https://arxiv.org/html/2608.18085#bib.bib1)\)\。然而,这些研究大多在开放式或非任务环境中评估人格实现。因此,它们表明人格可以在LLM输出中被表示和操纵,但未确定人格调节如何与模式约束、API决策或多轮任务完成相互作用。

### 2\.3个性化对话与用户建模

个性化对话研究系统如何适应用户特征、偏好或推断的对话倾向。最近的综述将这一方向定位为LLM个性化的一部分,其中模型以用户特定上下文(如事实、风格、人设描述或类似特质的档案)为条件,使对话随时间更相关、更连贯Tsenget al\.\(2024 (https://arxiv.org/html/2608.18085#bib.bib22)\); Zhanget al\.\(2018 (https://arxiv.org/html/2608.18085#bib.bib21)\); Lotfiet al\.\(2023 (https://arxiv.org/html/2608.18085#bib.bib1)\)\。

最近的基于LLM的工作还探讨了人格感知的对话生成,其中用户档案或对话历史被用于改善跨交互的人格一致性Liuet al\.\(2025 (https://arxiv.org/html/2608.18085#bib.bib24)\)\。这条研究线与我们关注的人格感知交互相关,但它并非为模式引导的任务导向对话设计,在该类对话中系统必须满足槽位约束、发出有效的API调用并完成用户目标。与此同时,基于LLM的TOD用户模拟使用提示的LLM生成目标驱动的用户行为,用于训练或评估对话系统Algherairy and Ahmed \(2025 (https://arxiv.org/html/2608.18085#bib.bib23)\); Davidsonet al\.\(2023 (https://arxiv.org/html/2608.18085#bib.bib25)\)\。

总的来说,先前的工作在很大程度上分别研究了TOD和人格。TOD研究强调结构、基线一致性和任务有效性,而人格研究强调特质表达、人设一致性和可控性。我们的框架通过将模拟用户以大五人格特质为条件,并评估人格访问如何影响模式基线的系统行为、成对用户满意度以及跨多个模型和评估指标的特质实现,将这些方向联系起来。

## 3方法与实验设置

我们使用模式引导对话(SGD)数据集Rastogiet al\.\(2020 (https://arxiv.org/html/2608.18085#bib.bib13)\)构建了一个用于人格感知任务导向对话的受控评估框架。该框架模拟了基于LLM的用户代理和基于LLM的系统代理在匹配任务设置下的交互。在不同条件下,任务模式、领域、演示示例和对话生成规则保持不变;主要的实验变量是系统代理对人格信息的访问权限,遵循第1节 (https://arxiv.org/html/2608.18085#S1)引入的“神谕”、“尝试”和“中立”设置。

### 3\.1任务导向对话框架

每个对话都基于SGD任务模式,该模式指定了完成任务所需的领域、意图、槽位和API结构。两个代理都在无需微调的单次提示设置中运行。每次生成都以领域内演示、相关模式和API规则、操作说明以及截至第t轮的对话历史为条件。

系统代理生成自然语言响应或API调用。遵循先前工作Mosharrofet al\.\(2025 (https://arxiv.org/html/2608.18085#bib.bib7)\),我们将API调用表示为:

APICall=\(I,\{\(si,vi\)\}\),\\text\{APICall\}=\\big\(I,\\\{\(s\_\{i\},v\_\{i\}\)\\\}\\big\),

其中II是领域的意图,\(si,vi\)\(s\_\{i\},v\_\{i\}\)是槽位-值赋值。这种表示使我们能够评估对话是否保持在任务模式的基线上,以及系统是否使用有效的槽位值完成了预期的搜索或预订目标。

### 3\.2人格特质规范

我们使用大五人格框架来建模用户人格,该框架捕捉了五个维度上的广泛行为差异Digman \(1900 (https://arxiv.org/html/2608.18085#bib.bib15)\); Goldberg \(2013 (https://arxiv.org/html/2608.18085#bib.bib16)\); Wiggins \(1996 (https://arxiv.org/html/2608.18085#bib.bib17)\); De Raad \(2000 (https://arxiv.org/html/2608.18085#bib.bib18)\); Jianget al\.\(2024 (https://arxiv.org/html/2608.18085#bib.bib19)\)\。为评估典型的大五人格特质及其对立变体,每个对话被分配以下十种特质之一的目标人设:外向、内向、随和、不随和、尽责、不尽责、神经质、稳定、开放、封闭。

在每次运行中,用户代理被分配一个目标特质。用户被指示通过自然的对话行为隐式表达该特质,而不是明确命名该特质。此设计允许我们测试人格是否能在任务导向交互中实现,同时系统仍然满足模式和API约束。

### 3\.3提示与人格访问条件

两个代理都使用相同的通用结构进行提示:任务说明、领域模式和API规范、领域内TOD演示对话、操作规则和对话历史。

相似文章

超越合作模拟器:为LLM代理的稳健评估生成逼真的用户角色

arXiv cs.AI

提出了Persona Policies(PPol),一种即插即用的控制层,利用LLM驱动的进化程序搜索来生成多样且逼真的用户角色,用于评估LLM代理。相比基线实现了33-62%的适应度提升,逼真度评分达到80.4%,并将代理鲁棒性提升了+17%的任务成功率。

PersonaVLM:长期个性化多模态大语言模型

Hugging Face Daily Papers

PersonaVLM 提出了一种个性化多模态大语言模型框架,通过记忆保留、多轮推理和响应对齐实现长期用户适应,在新推出的 Persona-MME 基准测试中比 GPT-4o 高出 5.2%。