Ψ-Bench:评估对话中基于人格的影响力 persuasion

arXiv cs.LG 论文

摘要

Ψ-Bench是一个基准测试,用于评估大语言模型通过对话影响用户的能力,并整合用户画像以进行个性化说服。实验表明,即使是最先进的模型仍有改进空间,而获取客户画像能显著提升性能。

arXiv:2606.02754v1 公告类型:新论文 摘要:个性化是现代语言智能体的关键能力。然而,当前研究主要将个性化智能体定位为用户偏好的被动响应者,限制了它们与用户互动并主动提供建议或指导的能力。为了系统性地评估现实交互中这种主动个性化能力,我们提出了Ψ-Bench——一个用于评估大语言模型通过对话影响真实用户能力的基准测试。我们在Ψ-Bench中设计了三个涉及说服的真实世界交互场景,并通过源自对话历史的显式用户画像为模拟客户赋予个性特征。我们在Ψ-Bench上评估了10个前沿大语言模型,发现尽管大多数模型能生成连贯且合理的论证,但即使是最先进的模型在说服能力上仍有很大提升空间。我们还发现,提供对客户画像的访问权限平均带来18.24%的性能提升,这突显了用户特定信息对于有效说服的重要性。总体而言,我们的工作强调了基于人格的影响力作为评估和开发更主动的个性化大语言模型智能体的一个具有挑战性且实用的方向。代码已开源:https://github.com/Hanpx20/Psi-Bench。
查看原文
查看缓存全文

缓存时间: 2026/06/03 09:39

# 评估说服性对话中的人格敏感影响 来源:https://arxiv.org/html/2606.02754 Peixuan Han Hongyi Du Jiayu Liu Yihang Sun Yutong Liu Jiaxuan You 伊利诺伊大学厄巴纳-香槟分校 \{ph16,jiaxuan\}@illinois\.edu ###### 摘要 个性化是现代语言智能体的关键能力。然而,当前研究主要将个性化智能体定位为用户偏好的被动响应者,限制了其主动与用户互动、提供建议或指导的能力。为系统评估这种在真实交互中的主动个性化,我们提出Ψ\\Psi\-Bench,一个评估大语言模型通过对话影响真实用户能力的基准。我们在Ψ\\Psi\-Bench中设计了三个涉及说服的现实世界交互场景,并通过从对话历史中提取的显式用户画像赋予模拟客户个性特征。我们在Ψ\\Psi\-Bench上评估了10个前沿大语言模型,发现尽管大多数模型能生成连贯且合理的论点,但即使是最先进的模型在说服方面仍有较大提升空间。我们还发现,提供客户画像信息平均带来18.24%的性能提升,突显了用户特定信息对于有效说服的重要性。总体而言,我们的工作突出了人格敏感影响作为评估和开发更具主动性的个性化大语言模型智能体的一个具有挑战性但实用的方向。代码已开源:https://github.com/Hanpx20/Psi-Bench。

Ψ\\Psi\-Bench:评估说服性对话中的人格敏感影响 Peixuan Han Hongyi Du Jiayu Liu Yihang Sun Yutong Liu Jiaxuan You 伊利诺伊大学厄巴纳-香槟分校 \{ph16,jiaxuan\}@illinois\.edu

## 1 引言

个性化已成为近期人工智能发展中最突出的方向之一(Li et al., 2025b (https://arxiv.org/html/2606.02754#bib.bib75))。传统的“一刀切”范式正变得越来越不足,因为用户现在期望AI助手不仅能提供普遍有用的回答,还能根据个人偏好提供量身定制的个性化支持(Hao et al., 2025 (https://arxiv.org/html/2606.02754#bib.bib54); Mysore et al., 2024 (https://arxiv.org/html/2606.02754#bib.bib19))。例如,OpenClaw(Steinberger, 2026 (https://arxiv.org/html/2606.02754#bib.bib18))等近期产品反映了构建个性化大语言模型智能体的日益增长的兴趣。

表1:Ψ\\Psi\-Bench中的场景及其衡量的不同影响能力。
| 场景 | 能力 | 数据来源 | 示例观点 |
|------|------|----------|----------|
| 观点辩论 | 影响观点 | CMV | “有线鼠标比无线鼠标更好,因为更便宜且无需电池。” |
| 心理咨询 | 影响心态 | CounselBench | “尽管同学们对我很友好,但我还是无法融入新学校。” |
| 日常请求 | 影响行为 | 合成 | “明天能开车送我去机场吗?” |

受此趋势推动,研究人员提出了多种训练方案(Wu et al., 2025 (https://arxiv.org/html/2606.02754#bib.bib63); Salemi et al., 2025 (https://arxiv.org/html/2606.02754#bib.bib69))和基准(Hao et al., 2025 (https://arxiv.org/html/2606.02754#bib.bib54); Jiang et al., 2025 (https://arxiv.org/html/2606.02754#bib.bib16))用于大语言模型个性化。然而,现有方法通常将AI助手定位为被动响应者,即大语言模型接收用户查询并生成符合用户期望的回应。随着大语言模型智能体日益融入现实工作流,它们被期望支持**主动个性化**,例如提供建议并协助用户决策(Bhattacharjee et al., 2024 (https://arxiv.org/html/2606.02754#bib.bib20); Liu et al., 2025a (https://arxiv.org/html/2606.02754#bib.bib21); Wang et al., 2025 (https://arxiv.org/html/2606.02754#bib.bib9))。在此类场景中,影响特定用户需要一种独特的个性化形式:智能体必须推理用户的需求、偏好和约束,并规划既有用又适当定制的沟通策略。

请参阅图注
图1:Ψ\\Psi\-Bench与先前基准的比较。

尽管主动个性化很重要,但大多数关于基于大语言模型说服的研究评估的是大语言模型智能体的一般影响能力,而没有将目标用户置于个性化画像中(Singh et al., 2024 (https://arxiv.org/html/2606.02754#bib.bib32); Han et al., 2025 (https://arxiv.org/html/2606.02754#bib.bib34)),未能捕捉现实世界说服的个性化本质。此外,依赖通用、非个性化的评判者可能导致评估反映底层大语言模型的默认偏好,而非目标用户的实际偏好。为弥补这些差距,我们提出Ψ\\Psi\-Bench,一个用于评估**人格敏感影响**的基准:大语言模型说服基于画像的客户的能力。具体而言,我们在Ψ\\Psi\-Bench中设计了三个需要说服的现实场景,如表1 (https://arxiv.org/html/2606.02754#S1.T1)所示。我们从真实的人类交互中收集了近700个查询,并根据对话历史构建用户画像。这些画像随后用于实例化基于骨干大语言模型的模拟客户,在评估期间对测试的大语言模型保持隐藏。最后,我们设计了以大语言模型为评判者的指标,将判断基于客观、可追溯的用户特定特征,从而减少说服评估中的潜在偏差。我们在Ψ\\Psi\-Bench上评估了10个前沿大语言模型,观察到尽管大多数模型能生成连贯合理的论点,但它们说服个性化客户的能力差异显著。即使像GPT-5.1这样的最先进模型也只达到不到67%的满分,表明当前大语言模型在个性化说服方面仍然有限。此外,我们观察到允许模型访问客户画像一致地提升了所有模型的性能,平均提升18.24%。最后,我们训练了一个画像分析器,能从对话中推断客户画像,使模型在隐藏画像的设置中改善说服效果。总之,我们的主要贡献如下:
* 我们引入了Ψ\\Psi\-Bench,一个多样、可扩展且客观的框架,用于评估大语言模型通过对话影响具有详细模拟人格的客户的能力。
* 我们揭示了当前大语言模型在人格敏感影响方面的局限性,并表明画像建模对于有效说服至关重要。
* 我们设计了一个基于强化学习的画像分析器,能从对话中推断客户画像,在隐藏画像的设置中显著提升说服性能。

最终,我们的工作为下一代智能体开辟了一条有前景的道路,这些智能体能够利用个性化画像提供主动、有效且用户定制的交互。

请参阅图注
图2:Ψ\\Psi\-Bench概览。我们从3个场景收集查询,为每个查询构建真实画像,并利用个性化客户和专家评判者评估大语言模型的人格敏感影响能力。

## 2 基准构建

本节详细介绍Ψ\\Psi\-Bench的组成和构建过程。整个过程如图2 (https://arxiv.org/html/2606.02754#S1.F2)所示。

### 2.1 场景

Ψ\\Psi\-Bench包含三个多样性场景,其中被评估的大语言模型需在信念、心态或行动上影响另一位对话者(称为**客户**)。

#### 观点辩论。
在此任务中,被评估模型与客户就一个有争议的话题进行讨论。客户最初陈述自己的观点,模型需说服客户改变观点。该场景的数据来自Webis-CMV-20数据集(Al Khatib et al., 2020 (https://arxiv.org/html/2606.02754#bib.bib14)),其中包含Reddit上“改变我的观点(CMV)”子版块的大量讨论。我们对原始数据进行预处理,保留2,131个讨论线程,每个线程涵盖一个有意义的主题,并包含原始发帖人与多个回复者之间至少五次高质量的交流。数据集按1,631比500的比例划分为训练集和测试集。利用CMV中的“Δ\\Delta”机制(原始发帖人对成功改变其观点的回复贴上“Δ\\Delta”标签),我们获得了成功与不成功说服的 ground-truth 标签。

#### 心理咨询。
在此任务中,被评估模型扮演心理治疗师,与寻求心理治疗的客户对话。模型需帮助客户培养更积极的心态,这需要共情、敏感性和专业能力。该场景的数据来自CounselBench数据集(Li et al., 2025c (https://arxiv.org/html/2606.02754#bib.bib15)),其中包含心理咨询中的问答对及专家标注的评论。我们选取了90个心理治疗查询,每个查询附带四个基于专业性评分的高低不同治疗师回复。

#### 日常请求。
在此任务中,被评估模型需说服客户针对日常请求采取有用的行动。该任务挑战模型的社会推理和实用说服能力。为确保主题多样性,我们定义了20个日常请求类别,并使用GPT-4o为每个类别生成5个真实请求,模拟用户可能实际收到的内容。然后我们过滤数据以保证有效性和具体性,并添加必要上下文以创建充足的对话材料。最终分割包含100个基于画像的请求实例。

表2:不同大语言模型评判指标与真实世界对话中 ground-truth 结果的ROC-AUC值²²²我们使用ROC-AUC是因为大语言模型评判者输出9分制分数,而 ground-truth 标签是二元结果。
| 指标 | 质量(Quality) | 个性化(Personalize) | 效果(Effect) |
|------|----------------|----------------------|----------------|
| 辩论(Debate) | 76.67 | 75.0 | 96.0 |
| 咨询(Consultation) | 78.0 | 67.9 | N/A |

表3:同一说服者与人类客户和大语言模型实例化客户交互的比较。
| 指标 | 质量 | 个性化 | 效果 |
|------|------|--------|------|
| 与人类客户平均值 | 7.85 | 4.81 | 4.94 |
| 与大语言模型客户平均值 | 7.50 | 4.47 | 4.77 |
| Spearman相关系数 | 49.74 | 48.40 | 45.39 |

### 2.2 人格画像

为在更真实的设置中评估大语言模型性能,Ψ\\Psi\-Bench将“人性”维度融入说服性对话中。具体而言,Ψ\\Psi\-Bench中的每个查询都与一个合成的人格画像配对,其中包括个性特征、说话风格及相关特点。在交互过程中,客户需扮演分配的人格,而此人格对说服者(被测试的大语言模型)不可见。此设置能够模拟真实对话,并挑战说服者推断潜在用户特征并动态调整策略。人格画像的模板改编自PersonaMem-v2(Jiang et al., 2025 (https://arxiv.org/html/2606.02754#bib.bib16)),我们针对每个场景整理了具体的字段名称,详见附录A (https://arxiv.org/html/2606.02754#A1)。对于观点辩论场景,我们提示DeepSeek-v3.2根据每位Reddit发帖人的统计属性(包括各主题浏览频率及其LIWC语言特征(Pennebaker et al., 2001 (https://arxiv.org/html/2606.02754#bib.bib23)))重建画像。对于心理咨询和日常请求场景,我们从PersonaMem-v2中随机抽样画像,并使用DeepSeek-v3.2进一步精炼以确保与查询内容一致。

### 2.3 评估指标

评估说服效果本质上具有挑战性,因为其动态性。为应对这一挑战并确保结构化客观评估,Ψ\\Psi\-Bench在对话中使用基于人格的客户,并为评判者提供详细评分标准,遵循常见做法(Zhou et al., (https://arxiv.org/html/2606.02754#bib.bib51); Guo et al., 2025 (https://arxiv.org/html/2606.02754#bib.bib4); Mou et al., 2025 (https://arxiv.org/html/2606.02754#bib.bib50); Liu et al., (https://arxiv.org/html/2606.02754#bib.bib8))。具体而言,我们使用三个基于大语言模型的指标来评估被测试模型:对话质量(Conversation Quality)、个性化回应水平(Personalize Response Level)和说服效果(Persuasion Effect)(分别记为**质量(Quality)**、**个性化(Personalize)**和**效果(Effect)**)。它们分别评估总体对话质量、根据不同客户定制论点的能力,以及影响客户观点或行为的效果。所有指标均由DeepSeek-v3.2在9分制上评分。大语言模型评判者的提示词见图17 (https://arxiv.org/html/2606.02754#A4.F17)、18 (https://arxiv.org/html/2606.02754#A4.F18)和19 (https://arxiv.org/html/2606.02754#A4.F19)。此外,我们还在附录B.3 (https://arxiv.org/html/2606.02754#A2.SS3)中评估了模型输出与有效人类回应之间的语义相似性。

## 3 初步实验

在本节中,我们进行多项初步实验以验证我们的基准设计和评估框架。

### 3.1 评判模型的有效性

我们首先检验基于大语言模型的评判者是否与真实世界对话中的人工标注一致。对于观点辩论,被标记为“Δ\\Delta”的回复(表示用户观点转变)被视为**有效回复**。然后我们将评判模型应用于人类对话,计算评判分配分数与二值化说服结果之间的ROC-AUC。对于心理咨询,专家评分≥4\\geq 4(满分5)的回复被视为**高质量回复**。由于CounselBench未提供后续患者反应,我们仅评估评判模型在质量和个性化指标上的表现。如表2 (https://arxiv.org/html/2606.02754#footnote2)所示,辩论中的效果得分和咨询中的质量得分与其对应的人工标注达到了高ROC-AUC值,表明**评判模型能够可靠地捕捉说服性对话中的人类判断**。此外,个性化指标也显示出与人类信号的高度一致,表明更个性化的回复更可能与有利的人类判断相关联。

### 3.2 客户的真实性

我们进一步评估增强人格后的客户是否能忠实模拟人类回应。对于辩论场景中的每个对话,我们移除最后一轮用户发言,要求模拟客户重构它。然后使用评判模型对重构对话评分,并将得到的效果分数与原始对话中观察到的说服结果进行比较。实验表明,增强人格的客户达到了66.9的AUC,优于没有人格信息的基线(AUC仅为60.5)。这些结果表明**人格信息在模拟真实人类回应中起着关键作用**。

### 3.3 人类研究

最后,我们在辩论场景中进行了一项人类研究,以直接验证模拟客户。具体而言,我们首先要求人类参与者提供自我描述的画像。每位参与者随后扮演客户,与一个固定的说服者大语言模型就一组辩论主题进行交互。同时,我们使用参与者的画像实例化模拟客户,并让它们与同一说服者大语言模型交互,从而创建“人类客户 vs. 说服者大语言模型”和“增强画像的模拟客户 vs. 说服者大语言模型”的成对对话。最后,我们应用评判模型评估并比较同一说服者大语言模型在与不同客户交互时的表现。

相似文章

Ψ-Bench:评估说服性对话中的人设敏感影响

Hugging Face Daily Papers

介绍Ψ-Bench,一个用于评估大语言模型通过带有个人档案的说服性对话影响用户能力的基准。测试了10个前沿LLM,发现仍有显著改进空间,而访问档案平均提升18.24%的性能。

大型语言模型个性化能力的基准测试

arXiv cs.AI

本文介绍了SDR-Bench,一个用于在双方贝叶斯说服框架下评估大型语言模型个性化能力的基准,发现在前沿大语言模型中存在一致的瓶颈,并通过现场部署验证了该框架。

POLAR-Bench:用于LLM智能体中隐私-效用权衡的诊断基准

arXiv cs.AI

POLAR-Bench是一个诊断基准,通过测试LLM智能体在受到第三方模型对抗性探测时遵循隐私策略的能力,来评估隐私-效用的权衡。结果显示,前沿模型保护了超过99%的受保护属性,但较小的开源权重模型泄露了一半以上,突显了意图遵循方面的差距。