偏好树优化:利用前瞻模拟增强目标导向对话

arXiv cs.CL 论文

摘要

本文介绍了偏好树优化(PTO)框架,该框架通过前瞻模拟生成偏好数据,以迭代改进目标导向对话代理。实验表明,在动机访谈场景中取得了性能提升。

arXiv:2608.12062v1 公告类型:新 摘要:开发能够进行多轮、目标导向对话的对话系统仍然是一项重大挑战,尤其是在数据有限的专门领域。本研究提出了一种名为偏好树优化(PTO)的新框架,旨在通过使用一种称为“带前瞻的偏好树”(Preference Tree with Look-Ahead)的方法生成偏好数据,来迭代改进此类对话系统中的代理模型。我们聚焦于动机访谈(MI)——一种旨在促进行为改变的咨询技术——利用虚拟患者和评估器(oracle evaluator)模拟对话并生成丰富的偏好数据集。通过将此方法与直接偏好优化(DPO)相结合,我们旨在通过迭代训练周期增强代理的决策能力。所提出的框架解决了数据稀缺问题,并推动了目标导向领域中更细致、更有效的对话系统的发展。实验评估表明,PTO框架增强了对话代理在动机访谈(MI)领域内目标导向对话中的表现。使用PTO训练的模型在会话满意度和工作联盟等关键指标上始终优于基线。此外,纳入前瞻模拟改善了对长期计划的规划,并带来了更有效的对话策略,其中更深的前瞻配置产生了最稳定和高分的结果。
查看原文
查看缓存全文

缓存时间: 2026/08/13 15:29

# 偏好树优化:通过前瞻模拟增强目标导向对话

来源:https://arxiv.org/html/2608.12062

Lior Baruch  
所属机构:计算机科学学院  
所属机构:以色列赫兹利亚赖希曼大学  
邮箱:[lior95bar@gmail\.com](mailto:[email protected])  

Moshe Butman  
所属机构:计算机科学学院  
所属机构:以色列赫兹利亚赖希曼大学  
邮箱:[moshe\.butman@gmail\.com](mailto:[email protected])  

Kfir Bar  
所属机构:计算机科学学院  
所属机构:以色列赫兹利亚赖希曼大学  
邮箱:[kfir\.bar@runi\.ac\.il](mailto:[email protected])  

Doron Friedman  
所属机构:传播学院  
所属机构:以色列赫兹利亚赖希曼大学  
邮箱:[doronf@runi\.ac\.il](mailto:[email protected])  

2026年8月12日

###### 摘要

开发能够进行多轮、目标导向对话的对话系统仍然是一个重大挑战,尤其是在数据有限的专业领域。本研究提出了一种名为**偏好树优化(PTO)**的新框架,旨在通过一种名为**前瞻偏好树**的方法生成偏好数据,从而迭代改进此类对话系统中的智能体模型。我们聚焦于动机性访谈(MI)——一种旨在促进行为改变的咨询技术——利用虚拟患者和神谕评估器来模拟对话并生成丰富的偏好数据集。通过将该方法与直接偏好优化(DPO)相结合,我们希望在迭代训练周期中增强智能体的决策能力。所提出的框架解决了数据稀缺问题,并推动了目标导向领域更细致、更有效的对话系统的发展。

实验评估表明,PTO框架在动机性访谈(MI)领域内增强了对话智能体在目标导向对话中的表现。经过PTO训练的模型在会谈满意度和工作联盟等关键指标上持续优于基线模型。此外,加入前瞻模拟带来了更好的长期规划和更有效的对话策略,其中更深的前瞻配置产生了最稳定且得分最高的结果。

## 1 引言

目标导向对话系统旨在通过交互式对话实现特定目标。在专业领域开发此类系统具有挑战性,因为交互的复杂性和领域特定数据的稀缺性。动机性访谈(MI)就是这样一个领域——它是一种通过协作、以客户为中心的对话来促进行为改变的咨询方法,要求对话智能体具备细致的理解和适应能力 [Miller & Rollnick 1991](https://arxiv.org/html/2608.12062#bib.bib5)。

本研究引入了一个用于迭代改进目标导向对话系统中智能体模型的框架,称为**偏好树优化(PTO)**(见图1 [https://arxiv.org/html/2608.12062#S1.F1](https://arxiv.org/html/2608.12062#S1.F1)),该框架通过一种名为**前瞻偏好树**的新方法生成偏好数据。该方法系统地模拟各种对话路径,并使用神谕评估器对它们进行评估以生成偏好数据。我们使用这些偏好数据配合直接偏好优化(DPO)[Rafailov et al. 2023](https://arxiv.org/html/2608.12062#bib.bib8)来迭代优化智能体模型,增强其决策能力。

我们的方法利用了先前MI研究中已有的虚拟患者和评估器 [Yosef et al. 2024](https://arxiv.org/html/2608.12062#bib.bib10),使其成为我们框架的理想试验平台。通过应对数据稀缺和对细致交互需求等挑战,我们旨在为能够进行有效、目标导向对话的对话系统的发展做出贡献。

类似的基于偏好的策略已经在定义良好的分析任务(如游戏、编程和数学)中改进了模型。然而,它们在人本领域(如动机性访谈)中的应用——在这些领域中目标是主观的,细致的沟通是关键——在很大程度上仍未得到探索。

参见图注  
图 1:偏好树优化(PTO)框架。该框架以两个迭代步骤运行:(i) **偏好数据生成**:用户模型被提示一系列属性以模拟多样的用户个性。对于每个数字用户个性,**前瞻偏好树**(第3.1节 [https://arxiv.org/html/2608.12062#S3.SS1](https://arxiv.org/html/2608.12062#S3.SS1))方法与神谕评估器及当前智能体模型(`Agent_Modelt`)结合使用,生成一个探索各种对话路径的偏好树。这些树被聚合为一个全面的偏好数据集。(ii) **模型训练**:当前智能体模型在新生成的偏好数据集上使用直接偏好优化(DPO)进行训练,从而得到一个改进的模型(`Agent_Modelt+1`)。然后,更新后的智能体模型用于下一次迭代,重复该过程以实现持续改进。  
PTO框架被专门设计为一种离线训练范式。尽管DPO过程计算密集——因为它在训练期间的每个模拟决策点都会被应用——但这一成本仅在模型开发期间产生一次。训练完成后,自动化治疗师被部署用于实时对话,此时推理过程快速而高效。

这项工作对目标导向对话系统的发展做出了多项贡献。首先,我们引入了**前瞻偏好树**,这是一种新方法,通过系统模拟和评估潜在的对话轨迹来生成高质量的偏好数据,从而促进从交互中更有效地学习。其次,我们提出了**偏好树优化(PTO)**框架,该框架将这些偏好数据与**直接偏好优化(DPO)**相结合,在连续的训练周期中迭代细化智能体的决策能力。第三,我们在具有挑战性的**动机性访谈(MI)**领域验证了我们的方法,利用虚拟患者和神谕评估器模拟真实、高风险的对话场景。最后,我们的方法论为将基于偏好的优化应用于其他专业对话领域提供了广泛的见解和可推广的策略。

## 2 背景与相关工作

自然语言处理(NLP)的最新突破和大语言模型(LLMs)的发展极大地推动了对话系统的进步。然而,为专业领域(如动机性访谈(MI))设计目标导向系统仍然特别具有挑战性,原因在于领域特定数据的有限性以及管理细致、多轮交互的复杂性。纯生成模型主要依赖于似然估计,可能不会自然地表现出目标导向行为。虽然强化学习(RL)为整合目标导向提供了一条潜在途径,但在心理学等领域识别合适的奖励函数远非易事——不像数学或游戏等结构更清晰的领域,那里存在明确的优化策略。此外,诸如直接偏好优化(DPO)之类的方法提出了问题:它们能否充分促进目标导向行为?如果能,它们采用什么样的隐式奖励机制?

### 2.1 语言模型中的偏好优化

改进语言模型的关键方法之一涉及使其与人类偏好对齐。这种对齐帮助模型生成不仅连贯,而且上下文适宜并针对特定对话目标量身定制的响应。传统方法,如基于人类反馈的强化学习(RLHF)[Christiano et al. 2017](https://arxiv.org/html/2608.12062#bib.bib2),涉及基于人类对模型输出的评估来训练一个单独的奖励模型。然后,该奖励模型通过强化学习引导语言模型产生更受偏好的响应。尽管有效,但RLHF可能复杂且资源密集,因为需要维护一个独立的奖励模型并实现强化学习算法 [Ouyang et al. 2022](https://arxiv.org/html/2608.12062#bib.bib6)。

直接偏好优化(DPO)[Rafailov et al. 2023](https://arxiv.org/html/2608.12062#bib.bib8)提供了一种更简化的替代方案,通过直接使用偏好数据优化语言模型,消除了对单独奖励模型和强化学习复杂性的需求。DPO在大语言模型策略和奖励函数之间建立了直接映射,使得通过简单的交叉熵损失即可训练大语言模型以满足偏好数据。

### 2.2 合成数据生成与迭代自我改进

应对专业对话领域中的数据稀缺挑战,促使研究人员开发了将合成数据生成与迭代自我改进相结合的方法。总的来说,这些方法可以分为三类:基于评分的合成数据生成、基于自我评估的改进,以及基于搜索的树结构方法。

**基于评分的合成数据生成:** Pace等人 [Pace et al. 2024](https://arxiv.org/html/2608.12062#bib.bib7) 引入了**West-of-N**,一种利用语言模型为给定提示生成多个候选响应的方法。然后,奖励模型对这些响应进行评分,通过选择最好和最差的输出,该方法形成合成偏好对,用于优化奖励模型与人类偏好的一致性。类似地,Guo等人 [Guo et al. 2024](https://arxiv.org/html/2608.12062#bib.bib3) 提出了一种在线偏好直接对齐变体。他们的方法使用大语言模型作为标注器,对从当前模型中采样得到的响应对提供实时反馈。这种在线AI反馈(OAIF)方法通过持续更新偏好数据来解决离线数据集固有的分布漂移问题,从而增强对齐性能,特别是在细致判断至关重要的软性领域。

**基于自我评估的改进:** 另一类工作利用模型的内部评估机制来自我生成和优化合成数据。Yuan等人 [Yuan et al. 2024b](https://arxiv.org/html/2608.12062#bib.bib13) 提出了**自我奖励语言模型**,其中模型生成多个响应,并使用大语言模型作为裁判对它们进行排序。随后,得到的偏好数据与直接偏好优化(DPO)一起使用,以迭代增强响应生成和内部奖励估计。类似地,Liang等人 [Liang et al. 2024](https://arxiv.org/html/2608.12062#bib.bib4) 提出了**I-SHEEP**(迭代自我增强范式),一种模型合成数据、自我评估质量并过滤低质量响应,然后应用监督微调的框架。虽然这些基于自我评估的方法有效利用了模型自身的能力,但如果自我评估不够稳健,它们可能面临使内部偏差长期存在的风险。

**基于搜索和树结构的方法:** 第三类方法采用搜索策略来系统探索潜在结果。Xie等人 [Xie et al. 2024](https://arxiv.org/html/2608.12062#bib.bib9) 将蒙特卡洛树搜索(MCTS)与迭代偏好学习相结合,以生成和评估细粒度、步骤级的推理路径。收集到的偏好数据随后用于通过DPO优化模型。此外,先前关于**偏好树**的工作 [Yuan et al. 2024a](https://arxiv.org/html/2608.12062#bib.bib12) 证明了树结构方法可以有效管理编码、数学和逻辑等领域的复杂推理任务。Yu等人 [Yu et al. 2023](https://arxiv.org/html/2608.12062#bib.bib11) 引入了一种基于提示的搜索方法,其中大语言模型在规划中扮演多个角色,而无需额外训练。最近,Chen等人 [Chen et al. 2025](https://arxiv.org/html/2608.12062#bib.bib1) 开发了一种对话规划方法,通过利用对话的密集语义表示,减少对直接基于大语言模型模拟的依赖。在这些想法的基础上,我们的框架采用**前瞻偏好树**,使用专门的用户模型模拟完整的对话轨迹,专门针对动机性访谈等领域的目标导向对话系统。

总之,这些多样化的方法论展示了将合成数据生成与迭代自我改进相结合的潜力。它们的区别在于偏好数据的生成方式(是基于评分的选择、自我评估还是搜索探索),以及它们所针对的应用领域。我们的工作弥合了基于搜索和基于评分的范式:**前瞻偏好树**方法对对话轨迹进行树状结构探索,而神谕评估器提供基于评分的比较,使得通过**直接偏好优化(DPO)**进行迭代细化,以增强目标导向对话智能体在**动机性访谈**等专业领域的表现。与先前主要关注编码、数学或游戏等结构化任务的工作不同,我们的方法探索了在需要深度人类理解的领域中的基于偏好的优化,在这些领域中目标本质上是主观的且更难以量化。

### 2.3 动机性访谈与AI对话系统

动机性访谈(MI)是一种以客户为中心的咨询方法,旨在通过帮助客户探索和解决矛盾心理来引发行为改变 [Miller & Rollnick 1991](https://arxiv.org/html/2608.12062#bib.bib5)。在AI对话系统中实现MI带来了独特的挑战,因为需要共情、适应性,以及解释微妙对话线索的能力。

先前的研究已经探索了在模拟MI会谈中利用大语言模型的潜力。Yosef等人 [Yosef et al. 2024](https://arxiv.org/html/2608.12062#bib.bib10) 利用AI生成的患者模拟来评估MI会谈,强调了虚拟患者在训练和评估治疗性对话中的可行性。他们的工作表明,AI智能体可以在一定程度上参与MI对话,但也强调了在捕捉人类治疗师与患者互动的全部深度方面的局限性。

此外,Yosef等人使用MI特定的现有数据集对治疗师模型进行了微调,证明这种微调可以提升模型在治疗环境中的表现 [Yosef et al. 2024](https://arxiv.org/html/2608.12062#bib.bib10)。与依赖预先存在数据集的方法不同,我们的**偏好树优化(PTO)**框架使用**前瞻偏好树**方法从模拟对话中迭代生成训练数据,并通过直接偏好优化在每次迭代中优化模型。

## 3 方法

我们的方法论包括两个主要组成部分:用于偏好数据生成的**前瞻偏好树**方法,以及使用DPO优化智能体模型的迭代训练过程。

### 3.1 前瞻偏好树

**前瞻偏好树**方法通过模拟多个智能体响应及其后续对话轨迹来系统探索潜在的对话路径,如第A.1节 [https://arxiv.org/html/2608.12062#A1.SS1](https://arxiv.org/html/2608.12062#A1.SS1) 所示。这旨在使智能体能够预见其响应的长期影响。过程如下:

1. **智能体决策点**:在每一轮,智能体模型生成

相似文章

基于环境的LLM游戏智能体自动提示优化

arXiv cs.CL

介绍了一个针对LLM游戏智能体的自动提示优化框架,该框架将观察-行动流水线分解为两个智能体,并通过环境回报引导的进化循环迭代优化提示。在BabyAI任务上评估,显著提高了成功率(例如,在PutNext上从0%提升到72.5%),且无需更新模型权重。