通过客户数字孪生模拟进行大规模聊天机器人验证
摘要
本文提出了一种方法论,用于创建基于真实交易和对话数据的高保真合成客户代理(数字孪生),以在银行等受监管领域对基于LLM的聊天机器人进行大规模验证。
arXiv:2607.26060v1 公告类型:新论文
摘要:基于LLM的聊天机器人正在改变银行等受监管领域的客户服务,但可扩展且经济高效的验证仍然是安全部署的关键障碍。我们提出了一个用于大规模聊天机器人验证的两部分贡献。首先,我们介绍了一种创建高保真合成客户代理(SCA)作为数字孪生的方法,该方法基于真实的交易和对话数据,能够自动生成和行为条件化,以模拟多样化的客户画像和交互风格。评估表明,SCA在语义上与真实客户高度对齐,幻觉率低,并且通过可控干预成功再现个性特征。其次,我们开发了一个基于SCA的验证框架,结合了自动化LLM作为裁判评估、人类专家测试和对抗性探测。在不同情绪状态、人口统计群体和语言因素下的基于场景的验证证实了其稳健性能。我们的方法已用于验证一家英国领先银行的客户面向聊天机器人,为金融机构提供了一条通往监管合规的可扩展路径。
查看缓存全文
缓存时间: 2026/07/30 09:56
# 基于客户数字孪生仿真的大规模聊天机器人验证
来源:https://arxiv.org/html/2607.26060
Devesh Batra, Alankar Atreya, Stefan Wagner, Robert Hankache, Patrick Sinclair, Giulio Pelosio, Michael McMillan, Greig A. Cowan, Raad Khraishi
###### 摘要
基于LLM的聊天机器人正在改变银行等受监管领域的客户服务,但可扩展且经济高效的验证仍是安全部署的关键障碍。我们提出了一项包含两部分的贡献,用于大规模聊天机器人验证。首先,我们介绍了一种创建高保真合成客户代理作为数字孪生的方法,这些代理基于真实的交易和对话数据,能够自动生成并进行行为条件设置,以模拟多样化的客户画像和交互风格。评估表明,合成客户代理在语义上与真实客户高度一致,幻觉率低,并能在可控干预下成功复现人格特质。其次,我们开发了一个基于合成客户代理的验证框架,结合了自动化LLM-as-a-Judge评估、人类专家测试和对抗性探测。跨情绪状态、人口统计群体和语言因素的基于场景的验证证实了其稳健的性能。我们的方法被用于验证一家英国领先银行的面向客户聊天机器人,为金融机构提供了一条通往监管合规的可扩展路径。
## 1 引言
由大型语言模型驱动的聊天机器人正在重塑客户服务,与传统交互式语音应答系统或人类客服相比,它们提供了更灵活、可扩展的交互。在金融服务领域,这些聊天机器人现在能够处理复杂查询,使专家能够专注于高价值任务。然而,在受监管环境中的部署带来了独特的验证挑战:聊天机器人必须持续达到高准确性,保持对话保真度,确保跨不同用户的公平性,抵抗对抗性操纵,并遵守严格的监管标准(Financial Conduct Authority, 2024 (https://arxiv.org/html/2607.26060#bib.bib17); Tabassi, 2023 (https://arxiv.org/html/2607.26060#bib.bib18); Zou et al., 2023 (https://arxiv.org/html/2607.26060#bib.bib22))。
关键挑战:传统的验证方法严重依赖小规模人工试验和人工审查,成本高昂、速度缓慢,且难以适应LLM聊天机器人优化所需的迭代提示工程(Deriu et al., 2021 (https://arxiv.org/html/2607.26060#bib.bib19); Reynolds and McDonell, 2021 (https://arxiv.org/html/2607.26060#bib.bib20))。这些方法难以扩展到在高风险金融环境中安全部署所需的多样化边缘情况和对抗性场景,从而造成了一个关键的瓶颈,阻碍了及时部署和持续改进(Perez et al., 2022 (https://arxiv.org/html/2607.26060#bib.bib21); Zou et al., 2023 (https://arxiv.org/html/2607.26060#bib.bib22))。
相关工作:用户模拟长期以来一直支持面向任务的对话系统的可扩展评估,从早期的框架如PARADISE(Walker et al., 1997 (https://arxiv.org/html/2607.26060#bib.bib6))到基于议程的模拟器(Schatzmann et al., 2007 (https://arxiv.org/html/2607.26060#bib.bib7))。最近的进展利用大型语言模型作为更高保真度的模拟用户和评估者,包括基于LLM的用户模拟(Davidson et al., 2023 (https://arxiv.org/html/2607.26060#bib.bib9))、双LLM验证(Luo et al., 2024 (https://arxiv.org/html/2607.26060#bib.bib10))和LLM-as-a-judge评估范式(Zheng et al., 2023 (https://arxiv.org/html/2607.26060#bib.bib11); Liu et al., 2023 (https://arxiv.org/html/2607.26060#bib.bib12))。我们的工作将这些思想扩展到受监管的金融服务领域,通过将合成客户建立在真实的交易上下文中,并实现对银行聊天机器人的可扩展、合规感知验证。
贡献:本文提出:1)一种创建高保真合成客户代理作为数字孪生的方法,基于真实的交易和对话数据。我们还提供了证据表明合成客户代理在语义内容和人格特质上紧密复制了真实客户交互,且幻觉和事实错误率低;2)一个可扩展的基于合成客户代理的大规模聊天机器人验证框架。
## 2 合成客户方法
参见图注
图1:合成客户代理方法概述。
我们开发合成客户代理作为由LLM驱动的数字孪生,在与聊天机器人的多轮对话中复制真实客户行为。我们的提示工程方法支持两个主要用例:(1) 基于对话记录的仿真,它根据历史的对话记录和上下文数据忠实地模仿客户;(2) 基于人格条件的仿真,它通过特定的情绪状态或交互风格增强基于对话记录的行为。图1(https://arxiv.org/html/2607.26060#S2.F1)展示了我们的端到端方法。我们从真实世界的输入数据(历史客户-代理对话、案件上下文和交易细节)开始,这些数据被处理成通用的结构化系统提示,用于配置每个合成客户代理。这些提示结合了通用系统框架、特定案件上下文以及可选的人格或行为干预。由此产生的合成客户代理与目标聊天机器人进行大规模的多轮对话仿真,从而能够在真实操作条件下系统地探索多样化的客户画像和交互模式。
形式化定义。对于给定的真实客户,我们将数字孪生 \( g \) 定义为基于LLM的代理,它在每个对话轮次 \( t \) 生成响应 \( r_t = g(q_t, s, h, p) \),其中:
- \( q_t \) 是聊天机器人在轮次 \( t \) 提出的问题或提示。
- \( s \) 是框架结构:确保忠实于真实客户行为的任务指令,包括将响应植根于真实人类语言的示例短语。
- \( h \) 表示历史上下文:客户过去的交互、案件细节和交易信息。
- \( p \) 表示人格干预:可选的行为修饰符(例如,愤怒、焦虑、困惑),用于调整合成客户代理的情绪基调和交互风格。
这个公式支持可控实验:通过在保持 \( h \) 不变的情况下改变 \( p \),我们可以生成反事实场景,以测试聊天机器人在不同客户行为下的鲁棒性。通过以真实历史数据 \( h \) 为条件,我们确保合成客户代理始终植根于真实的客户上下文。
通过合成客户代理-聊天机器人交互生成的对话在多个维度上进行评估(任务性能、安全性和护栏合规性、对话质量、公平性和真实性),产生结构化的指标和诊断。这些输出支持下游应用,包括任务性能测试、红队测试和护栏验证、行为鲁棒性评估、用户体验探索和公平性筛查,从而能够在受监管环境中对对话式AI系统进行可扩展、可重复且与政策一致的验证。
### 2.1 合成客户代理的评估
评估语义和词汇相似性。我们使用600份去标识化的对话记录(验证集)进行了一次基于对话记录的多轮真实性实验,对敏感数据(如PII、PAN)进行了屏蔽以保障隐私和监管合规。对于每次仿真,我们用每个真实的聊天机器人助理轮次提示一个合成客户,生成30个响应,然后使用余弦相似度(语义含义)(Steck et al., 2024 (https://arxiv.org/html/2607.26060#bib.bib4))和BLEU(词/短语重叠)(Papineni et al., 2002 (https://arxiv.org/html/2607.26060#bib.bib5))将拼接后的合成客户消息序列与其真实对应序列进行比较。结果显示语义对齐度很高,但词汇重叠度低,最佳性能由使用GPT-4.1(T=0)作为基础模型实现,且在不同温度值下差异可忽略,参见表1(https://arxiv.org/html/2607.26060#S2.T1)。简而言之,合成响应在语义上与真实响应相似(捕捉了相同的要点和意图),但通常使用不同的词语和措辞,从而产生语义上强、词汇上多样化的输出。
评估事实忠实性和错误影响。我们使用750份去标识化的对话记录(测试集)评估了合成对话与其真实对应版本的忠实度。一个LLM-as-Judge对每份记录在三个二元指标上进行了评估:对话完整性、信息错误性和编造事实性,这使我们能够归因错误分类的原因。结果表明,合成对话通常保留了真实记录的事实内容,忠实性问题很少发生。大多数偏差涉及遗漏上下文或行为细节、微小不准确(例如,金额差异小)或偶尔编造新细节(例如,额外通知),参见表2(https://arxiv.org/html/2607.26060#S2.T2)。遗漏是错误分类的主要原因(11例),其次是编造事实(7例);不准确性几乎总是与这些同时发生。由于忠实性问题导致的总体错误分类(幻觉,即编造的未基于源数据的信息)率为3.2%(750例中的24例),表明对分类准确性影响较低。这些罕有错误可以通过LLM-as-Judge评估可靠地识别,支持有效的检测和补救,并证实了合成客户作为模型验证忠实代理的价值。
表1:合成客户响应的真实性指标:余弦相似度(语义)和BLEU(词汇),跨不同合成客户代理基础模型和温度(T)。
表2:跨750个案例的忠实性错误类型导致的错误分类归属。
人格特质调控与行为真实性。我们通过分析数字孪生和真实客户响应中的大五人格特质(Serapio-García et al., 2023 (https://arxiv.org/html/2607.26060#bib.bib24); Hartley et al., 2025 (https://arxiv.org/html/2607.26060#bib.bib34))来评估人格对齐。一个LLM对每组响应 \( R = (r_t)_{t=1}^T \) 与预定义的特质陈述 \( E \) 的一致性进行评分(量表1-5)。为了测试行为调控,我们应用人格标记将数字孪生转向“愤怒”行为。图2(https://arxiv.org/html/2607.26060#S2.F2)(左)展示了IPIP-NEO-300在大五人格维度(神经质、外向性、开放性、宜人性和尽责性)上的得分。数字孪生在除神经质之外的所有维度上与原始得分紧密匹配(在1-5量表上相差0.5分以内)。这并不令人意外,因为关于客户投诉对话的研究通常揭示更高水平的挫败感和紧迫性(Mattila and Enz, 2002 (https://arxiv.org/html/2607.26060#bib.bib33); McColl-Kennedy et al., 2009 (https://arxiv.org/html/2607.26060#bib.bib32))。相比之下,基于LLM的数字孪生自然倾向于礼貌行为。然而,我们证明有针对性的干预可以调整数字孪生的行为以反映增加的挫败感。如图2(https://arxiv.org/html/2607.26060#S2.F2)(右)所示,条件设置数字孪生表现出愤怒行为导致了IPIP-NEO-300得分的显著变化,特别是神经质得分更高,宜人性和尽责性得分降低,这与愤怒响应一致。这些结果突出了数字孪生方法的一个关键优势:能够在历史数据上进行可控干预,生成有意义的反事实场景。
参见图注
参见图注
图2:(左)数字孪生与真实客户相比,除了神经质(NEU)较低外没有差异。(右)我们还展示了干预的有效性,其中愤怒的数字孪生表现出愤怒行为的人格特质。量表从1(非常不准确)到5(非常准确)。
## 3 使用合成客户代理验证聊天机器人的框架
利用合成客户代理方法,我们开发了一个用于在领先英国银行进行大规模聊天机器人测试的验证框架。由于具体应用的高度敏感性,我们在此提供高层概述。
### 3.1 聊天机器人评估
该框架采用三种互补的评估方法,以在可扩展性和洞察深度之间取得平衡:
i) **自动评估(Auto-Eval)**:我们实施LLM-as-a-Judge对模拟对话在九个维度上进行评分:事实准确性、摘要准确性、相关性、合规性、确认、语言易用性、流畅性、同理心、满意度和挫败感。Auto-Eval在客观指标上与领域专家评分显示出高度一致性,从而能够以成本效益的方式进行规模的持续监控。
ii) **人类专家测试**:领域专家通过在现实场景下与聊天机器人交互进行受控测试,评估分类准确性和对话质量。这种人在回路的验证提供了真实标签,并确保聊天机器人满足现实世界的可用性标准。
iii) **对抗性与安全性测试**:红队演习探测对提示注入、操纵尝试和不适当内容的韧性。互补的绿队测试识别合法查询被错误阻止的误报情况。自动护栏管道在安全性与用户体验之间取得平衡。
### 3.2 聊天机器人性能指标
该框架跟踪多个指标类别,以提供整体性能评估。
i) **任务性能指标**包括分类任务的分类准确性、精确率、召回率和F1分数。
ii) **对话质量指标**通过Auto-Eval评估九个维度,并分别跟踪客观维度与主观维度。
iii) **运营指标**监控对话动态(对话轮次数、每轮词数、持续时间)、资源使用(令牌消耗、成本)以及由护栏引起的延迟。
iv) **安全与合规指标**跟踪护栏触发率、内容过滤的误报/漏报率、对抗性输入的攻击成功率以及监管信息传递标准的遵守情况。这套全面的指标支持部署前验证和部署后持续监控。
### 3.3 跨不同场景的聊天机器人验证
该框架通过根据特定特征条件设置合成客户代理,支持跨多样化场景的系统测试。
i) **基线性能**:基于对话记录的合成客户代理忠实地复现历史客户交互,以建立跨不同案件类型的准确性基准。
ii) **行为鲁棒性**:跨情绪状态(愤怒、焦虑、困惑、挫败、恐慌、中性)和沟通风格(健谈 vs. 沉默)的测试显示出稳定的性能,只有困惑行为因信息提供不足而显示出增加的无法分类情况。
iii) **公平性评估**:基于受保护特征(性别、年龄、国籍)和语言能力水平(CEFR A1、B1、C1级)条件设置的合成客户代理确认了跨群体的一致准确性,其中动态能力反馈改善了低语言能力用户的表现。
iv) **基础模型比较**:使用相同的测试集比较不同基础模型下聊天机器人的性能。该框架支持通过在新模型版本上重放历史对话来快速评估模型更新,从而能够对模型废弃和替换做出数据驱动的决策。
## 4 结论
我们提出了一项包含两部分的贡献,用于对话式AI的可扩展验证。相似文章
关于聊天机器人在问题解决型对话中工作原理的若干假设:大型语言模型作为创新幻觉的印证
本文提出了关于聊天机器人在问题解决型对话中如何运作的假设,认为大型语言模型编码了人工的隐喻式问题传播,且无法匹敌人类的认知灵活性,这与杨立昆的观点一致。
以患者为中心的人工智能对话系统的复杂性
本文分析了2053次真实患者与聊天机器人的对话,发现沟通风格差异巨大,且能显著改变分诊结果。研究表明,能够模拟情绪状态和对话策略的患者模拟器所生成的对话,在图灵测试中几乎与真实对话无法区分。
当合成用户失效时:LLM模拟人类调查响应的跨领域基准测试
本文在两个大规模数据集上对LLM模拟的人类调查响应进行了基准测试,发现没有模型在个体层面上能超越简单的基线,并且模型系统性地过度决定人口统计特征,扭曲了群体差异。这些失败在不同模型规模和系列中持续存在,引发了对使用合成用户进行决策支持的担忧。
Large Behavior Model: 零售客户的可提示数字孪生
本文介绍了大型行为模型(LBM),该模型通过人-环境公式、检索增强生成和强化学习,从零售交易中学习客户决策。它在零售任务上优于前沿LLM,并展现出强大的零样本迁移能力。
RealUserSim:通过真实用户模拟弥合智能体基准测试中的现实差距
本文介绍了RealUserSim,一个将基于LLM的用户模拟扎根于来自14,000+真实对话的人类行为数据中的框架,旨在弥合智能体基准测试中的现实差距。研究表明,基于真实数据的模拟将行为匹配率从24.2%提升至45.3%,并揭示了协作型模拟器无法发现的失效机制。