UP-NRPA:基于用户画像的嵌套展开策略自适应方法,用于面向目标对话系统中大语言模型的规划
摘要
本文提出UP-NRPA,一种在线框架,将用户画像与基于大语言模型的嵌套展开策略自适应相结合,无需离线训练即可动态定制对话策略,在多个对话任务上实现了100%的成功率。
arXiv:2606.13683v1 公告类型:交叉
摘要:针对当前对话策略规划方法难以动态适应不同用户特征的挑战,本文提出了一种基于用户画像的嵌套展开策略自适应(UP-NRPA)在线框架,该框架结合了大语言模型。与依赖模型训练并需要为用户群体离线学习强化学习策略模型的传统方法不同,UP-NRPA通过自适应机制实现对话策略的动态定制。这通过利用实时用户反馈以及从当前用户画像中映射出的个性、偏好和目标来实现,从而无需离线强化学习即可适应用户特征。在协作性和非协作性对话基准测试中,UP-NRPA展现出显著优势,在多个对话任务中达到了令人印象深刻的100%成功率。特别是在谈判任务中,销售与列表比率(SL)提高了56.41%。这表明UP-NRPA无需训练机制即可适应不同的用户需求,使对话系统能够适应用户特征。
查看缓存全文
缓存时间: 2026/06/15 08:59
# UP-NRPA:基于用户画像的嵌套展开策略自适应方法——面向目标导向对话系统的大语言模型规划
来源:https://arxiv.org/html/2606.13683
张发发¹,²,刘萌¹,²,陈翔宇¹,²,穆朝絮¹,²,³
¹ 安徽大学人工智能学院
² 安徽省安全人工智能重点实验室(安徽大学)
³ 鹏城实验室,深圳,中国
h\.wang\.13@ahu\.edu\.cn, \{wa23301160, w125221177, xiangyu0113\}@stu\.ahu\.edu\.cn, cxmu@tju\.edu\.cn
###### 摘要
针对当前对话策略规划方法难以动态适应多样化用户特征的挑战,本文提出一种基于用户画像的嵌套展开策略自适应(UP-NRPA)在线框架,集成大语言模型。与依赖模型训练、需要为不同用户群体准备离线强化学习策略模型的传统方法不同,UP-NRPA通过自适应机制实现对话策略的动态定制。该机制利用实时用户反馈以及从当前用户画像映射出的个性、偏好和目标,无需离线强化学习即可适应用户特征。在协作与非协作对话基准测试中,UP-NRPA展现出显著优势,在多个对话任务中实现了100%的成功率。特别是在谈判任务中,销售与挂牌比率(SL)提升了56.41%。这表明UP-NRPA无需训练机制即可适应多样化的用户需求,使对话系统能够自适应于用户特征。
参见说明图1:UP-NRPA框架概述。该框架将用户画像驱动的模拟器与嵌套展开策略自适应规划器相结合。通过多级蒙特卡洛模拟和基于奖励的策略自适应,智能体通过与不同用户角色的交互模拟,动态优化对话策略。
## 1 引言
随着大语言模型(LLMs)的发展,目标导向的对话系统取得了显著进展(Zhou et al., 2024; Synekop et al., 2024; Algherairy and Ahmed, 2024)。这些系统在目标与用户兴趣一致的场景中表现出色,例如餐厅预订、情感支持或多步骤任务指导(Deng et al., 2025; Li, 2024; Deng et al., 2024a),展现出强大的协作对话能力。然而,当对话目标与用户利益发生冲突时,例如在谈判或说服场景中,其性能显著下降(Deng et al., 2025)。因此,系统需要在对话中平衡目标达成与用户情感,以实现最佳交互效果。
随着对话系统的发展,涌现出许多新颖的解决方案(Deng et al., 2024a)。基于提示工程的方法通过精心设计的指令和上下文提示直接引导模型规划,或集成外部策略规划器与LLMs协作,从而构建高效的对话智能体(Zhang et al., 2023)。然而,这些方法虽有进展,仍存在局限性。离线强化学习方法对单一用户表现良好,但泛化能力较差,性能高度依赖高质量对话数据,导致训练成本高昂。诸如蒙特卡洛树搜索(MCTS)等在线搜索方法能够生成自然回复,但在目标导向对话任务中难以实现目标(Yu et al., 2023)。现有方法在用户画像建模方面有所不足。在真实对话场景中,每个用户都具有独特的个性特征,但现有方法在整合这些画像时表现不佳。离线强化学习难以训练出能够泛化到不同用户群体的策略规划器,导致对话智能体在遇到不同用户时表现出僵化的行为策略。在复杂的多用户场景中,如说服(Wang et al., 2019)、谈判(He et al., 2018)或情感支持(Liu et al., 2021; Zheng et al., 2023),现有对话智能体缺乏根据用户反馈动态调整策略的能力。这一局限性制约了其在需要深度交互、共情建立和信任构建的应用中的有效性。此外,现有方法在非协作任务中无法保持对话连贯性和目标导向性。它们无法捕捉不同用户间的行为变化并相应调整对话策略。总体而言,这些问题限制了基于LLM的对话系统的性能。
为应对多样化用户画像带来的对话规划挑战,已有若干创新性解决方案提出。其中,定制化策略规划(TRIP)(Zhang et al., 2024)方法通过将用户特征深度整合到策略规划过程中,实现了对个性化对话场景的有效适应。其创新之处在于将用户感知策略规划模块与基于群体的训练范式相结合,系统性增强了智能体的定制策略规划能力,克服了传统方法在单一用户模拟器下的局限性。在此基础上,用户定制化对话策略规划(UDP)(He et al., 2025b)进一步扩展了TRIP框架,采用先进扩散模型动态推断和建模用户画像。该方法引入了一种布朗桥启发机制,能够精确预测用户的响应模式和行为倾向。UDP不仅捕捉用户特征的实时变化,还能够在对话过程中动态调整策略规划,相较于TRIP取得了显著性能提升。
尽管TRIP和UDP方法在基于用户画像的对话系统中取得了进展,能够针对不同用户特征制定策略,但两种方法在对话任务性能指标上仍存在局限性。它们在对话成功率和对话轮次方面表现相对较差,需要更多交互轮次才能达成对话目标。然而,面向目标导向对话的嵌套展开策略自适应(NRPA-GD)(Wang et al., 2025a)方法采用策略自适应机制,在单一用户模拟器环境中实现了高效对话规划,显著提高了对话成功率。因此,我们提出了基于用户画像的嵌套展开策略自适应(UP-NRPA)方法。该方法将用户特征融入嵌套展开规划中,通过在线搜索和用户反馈动态调整对话策略。这使得UP-NRPA能够在多样化的用户场景中自适应地定制策略,有效解决不同用户群体对个性化对话规划的需求。我们的贡献总结如下:
- • 当前的对话策略规划需要离线强化学习,无法为未见过的用户画像实时动态调整策略。相比之下,UP-NRPA通过实时反馈动态规划策略,无需模型训练。
- • UP-NRPA将用户画像与在线策略优化相结合,使系统能够基于不同用户画像不断优化交互策略,从而提高对话成功率。
- • 在协作和非协作对话任务中,UP-NRPA在多个任务上达到了100%的成功率。基于Qwen2.5 14B模型,该方法相较于现有最先进方法将成功率提升了56.41%,验证了UP-NRPA的有效性。
## 2 相关工作
现有的提示工程方法,例如Ask-an-Expert (AnE),通过集成主动提示、自我反思和自我对弈,借助预定义的指令提示从上下文和历史中学习,增强LLMs的规划能力(Zhang et al., 2023; Chen et al., 2023; Fu et al., 2023)。然而,这些提示技术通常优先考虑用户满意度。用户模拟常常采用固定的中立角色,难以反映个体特征(Deng et al., 2023a)。即插即用对话策略规划器(PPDPP)(Deng et al., 2024b)和双过程对话规划(DPDP)(He et al., 2024)通过离线强化学习实现了更强的策略能力。此外,TRIP(Zhang et al., 2024)和UDP(He et al., 2025b)方法引入用户画像以识别用户类型并采用定制化对话策略。然而,这些方法仍依赖大量数据和离线训练,限制了它们在对话规划中为新用户调整策略的能力。潜在对话策略规划(LDPP)(He et al., 2025a)基于数据驱动的自主策略发现。在谈判、说服和情感支持等对话场景中,交互过程包含丰富的上下文信息。系统必须自主调整对话策略以实现预定交互目标。LDPP实现了从对话记录中的策略挖掘到策略规划学习的全过程。基于潜在空间中的离线分层强化学习算法,构建了高效的策略规划能力。零训练目标导向对话规划(GDP-Zero)利用LLMs同时处理先验策略、价值函数和用户/系统角色,实现对未知场景的MCTS规划(Yu et al., 2023)。NRPA是嵌套蒙特卡洛搜索的一个变体,通过多级策略自适应应用于目标导向对话系统(Wang et al., 2025b)。NRPA-GD通过引入在线NRPA搜索算法解决了离线强化学习的计算开销,从而提高了对话成功率。DialogXpert利用冻结的LLM模型为每个对话轮次生成少量高质量动作候选。然后,它利用一个基于固定BERT嵌入的紧凑型Q网络,通过时序差异学习训练,在缩减的特征空间中选择最优动作。通过追踪用户情感,DialogXpert在推进任务的同时做出定制化决策,建立真实的共情连接(Rakib et al., 2025)。我们提出的UP-NRPA模型将用户角色建模与嵌套展开相结合,基于用户反馈迭代优化最优动作序列,使对话智能体能够选择最优策略。
表1:对话规划方法在CraigslistBargain、ESConv基准上的比较。
算法1 UP-NRPA
1: LLM M_θ
2: 初始策略 π
3: 迭代次数 N
4: 学习率 α
5: 动作空间 A
6: 初始状态 s
7: 用户画像 U
8: 函数 UP-NRPA(level, π, s)
9: 如果 level=0 则
10: 返回 Playout(s, π, U)
11: 否则
12: bestScore ← -∞
13: bestSequence ← ∅
14: 对于 iteration=1 到 N 循环
15: (score, sequence) ← NRPA(level-1, π, s)
16: 如果 score > bestScore 则
17: bestScore ← score
18: bestSequence ← sequence
19: π ← Adapt(π, bestSequence, α, s)
20: 返回 (bestScore, bestSequence)
21: 函数 Adapt(π, sequence, α, s)
22: π′ ← π
23: currentState ← s
24: 对于 sequence 中的每个动作 a 循环
25: z ← ∑_{a′∈A} e^{π′(a′)}
26: 对于每个动作 a′∈A 循环
27: π′(a′) ← π′(a′) - α·(1/z)·e^{π′(a′)}
28: π′(a) ← π′(a) + α
29: currentState ← play(currentState, a)
30: 返回 π′
## 3 用户特定规划评估
为解决现有对话策略规划方法难以动态适应多样化用户特征的挑战,本文提出UP-NRPA在线框架,探索其规划自适应能力。研究考察两类任务:协作任务和非协作任务。协作任务包括情感支持场景中的合作对话任务ESConv和ExTES(Liu et al., 2021; Zheng et al., 2023),而非协作任务涵盖说服场景中的非合作对话任务P4G(Wang et al., 2019)以及谈判场景中的非合作对话任务CB(He et al., 2018)。首先,利用大五人格特质和决策风格定制用户画像。然后,GPT-5基于这些画像生成具有细粒度特征的用户描述。最后,通过对比实验验证UP-NRPA的任务性能。
### 3.1 用户画像设计
在现有研究基础上,我们将人物画像与用户模拟相结合,并在处理非协作任务时,从一组抵制策略中选择非合作行为。人物画像的生成和整合过程遵循TRIP(Zhang et al., 2024)的研究框架,同样设计两种角色类型,每种角色配备由大语言模型生成的连贯背景描述。这些描述涵盖两个关键维度:大五人格特质(Goldberg, 1992)和决策风格(Scott and Bruce, 1995)。同时,我们采用Dutt et al. (2021)提出的抵制策略来指导模拟相似文章
语言代理的策略与世界模型协同训练
本文介绍PaW,一种协同训练框架,在在线策略强化学习(on-policy RL)轨迹中向策略学习添加辅助世界模型监督,无需额外计算开销即可改进语言代理的训练。
AdaPlanBench:在世界和用户约束下评估大型语言模型智能体的自适应规划能力
AdaPlanBench是一个动态基准测试,用于评估LLM智能体在多轮交互中根据逐步显现的世界和用户约束进行自适应规划的能力。实验表明,当前模型尤其难以应对用户约束。
打破僵局:用于社交语言智能体的双尺度进化策略训练
本文提出了双尺度进化策略训练(DEPT),旨在解决社交语言智能体的进化僵局问题,利用非对称优势重塑技术在自博弈过程中恢复梯度信号。
在对话前了解你:面向多轮对话中LLM个性化的用户状态建模
本文提出PUMA,一个用于多轮对话中LLM个性化的框架,该框架建模潜在用户状态,并利用自由能原理选择对话行为,在医疗咨询基准测试中提升了长程对话效果。
RLMOpt:基于递归语言模型的自适应提示优化
RLMOpt 是一种提示优化器,它使用递归语言模型来驱动搜索策略本身,在多个基准测试上优于 GEPA 等现有方法,同时使用更少的 rollouts 并生成更短的提示。