利用轮次交替动态增强多方对话中的意图识别

arXiv cs.CL 论文

摘要

本文提出了一种多任务学习方法,通过利用轮次交替动态来增强多方对话中的意图识别,其性能优于忽略交互模式的现有方法。

arXiv:2608.28926v1 公告类型:新 摘要:我们提出了一种用于多方对话意图识别的多任务学习方法,该方法利用一个辅助任务来建模轮次交替动态。具体而言,我们引入了轮次转换熵,这是一种从说话者交替序列计算得到的自监督目标,用于量化交互模式的可预测性。在多个预训练模型上的实验表明,融入此辅助任务能够提升意图识别性能,优于忽略多方交互动态的现有方法。我们发现,所提出的连续目标可以作为单任务目标进行学习,这表明它是一个携带有用信息的实际信号。
查看原文
查看缓存全文

缓存时间: 2026/09/01 12:10

# 利用轮次转换动态进行多方对话中的意图识别
来源: https://arxiv.org/html/2608.28926

\\usetikzlibrary{shapes.geometric, arrows, positioning}\\tikzset{model/.style = {rectangle, draw, minimum width=2.2cm, minimum height=0.9cm, font=\\small}, question/.style = {rectangle, align=left, font=\\small, text width=6.5cm}, arrow/.style = {->, thick, shorten <=1pt, shorten >=1pt}, iterlabel/.style = {font=\\footnotesize, anchor=north east, inner sep=1pt}}

Alexis Lombard Gaël de Chalendar Nasredine Semmar  
附属机构:Université Paris-Saclay, CEA, List, Palaiseau, France  
邮箱:\{galo-daniel.castillolopez, alexis.lombard, gael.de-chalendar, nasredine.semmar\}@cea.fr

###### 摘要

我们提出了一种用于多方对话意图识别的多任务学习方法,该方法利用一个辅助任务来建模轮次转换动态。具体而言,我们引入了**轮次转换熵**,这是一种根据说话人转换序列计算得到的自监督目标,它量化了交互模式的可预测性。在多个预训练模型上的实验表明,融入此辅助任务能提升意图识别性能,优于忽略多方交互动态的现有方法。我们发现,所提出的连续目标可以作为单任务目标进行学习,表明它确实是一个承载有用信息的信号。

## 1 引言

††本文已被 EMNLP Industry Track 2026 接收,并对应作者版本的工作。  
用户意图检测是任务型对话系统的基本组成部分,它使对话代理能够理解用户需求并生成适当的回复 (Zhu et al., 2025) (https://arxiv.org/html/2608.28926#bib.bib15)。虽然意图识别在双人对话中已被广泛研究 (Zawbaa et al., 2024) (https://arxiv.org/html/2608.28926#bib.bib13); (Arora et al., 2024) (https://arxiv.org/html/2608.28926#bib.bib24); (Sali and Toraman, 2025) (https://arxiv.org/html/2608.28926#bib.bib25),但代理同时与多个用户交互的多方场景却被忽视了。最近的研究已经使用小型和大型语言模型来研究多方对话 (MPCs) 中的意图识别 (Castillo-López et al., 2025b) (https://arxiv.org/html/2608.28926#bib.bib36); (Liu et al., 2026b) (https://arxiv.org/html/2608.28926#bib.bib12)。然而,大多数方法未能利用多方交互动态中固有的信息,例如轮次转换行为、对话分离等 (Ganesh et al., 2023) (https://arxiv.org/html/2608.28926#bib.bib1); (Sapkota et al., 2025) (https://arxiv.org/html/2608.28926#bib.bib14)。

图 1:低熵和高熵轮次转换的示例。上方对话遵循结构化的说话人转换模式,呈现较低的轮次转换熵。下方对话表现出更多样化、更无序的说话人转换,导致更高的熵。²²²我们将在第 3.3 节 (https://arxiv.org/html/2608.28926#S3.SS3) 中定义熵的计算。注意,两个示例具有相同数量的说话人和轮次转换。  
在本文中,我们提出了一种多任务学习方法,该方法包含一个辅助任务来捕获多方对话意图识别中的轮次转换动态。与轮次转换相对容易预测的双人对话不同,MPCs 涉及多个潜在的下一个说话人,这使得说话人交互模式更加复杂 (Skantze, 2021) (https://arxiv.org/html/2608.28926#bib.bib2); (Castillo-López et al., 2025a) (https://arxiv.org/html/2608.28926#bib.bib16)。我们认为,这些模式为建模 MPCs 提供了有用的上下文线索,从而改善了这些场景下的意图识别。尽管诸如下一个说话人预测和听话人检测等任务已被广泛研究 (Gu et al., 2022) (https://arxiv.org/html/2608.28926#bib.bib6); (He et al., 2024) (https://arxiv.org/html/2608.28926#bib.bib5); (Mori et al., 2026) (https://arxiv.org/html/2608.28926#bib.bib3); (Inoue et al., 2025) (https://arxiv.org/html/2608.28926#bib.bib4),但它们通常需要额外的标注或对参与者数量进行假设。

为了解决这些局限性,我们引入了一个辅助回归任务,用于预测对话上下文中轮次转换模式的不确定性。给定目标话语之前的轮次,我们提取说话人-转换对(例如,说话人 A→说话人 B,说话人 B→说话人 C)并计算它们的香农熵 (Shannon, 1948) (https://arxiv.org/html/2608.28926#bib.bib11)。这种**轮次转换熵**量化了交互动态的可预测性:低熵表示更有序的轮次转换,而高熵表示更不可预测的轮次转换(图 2 (https://arxiv.org/html/2608.28926#footnote2))。通过学习预测这个量,意图识别模型被鼓励去捕获 MPCs 固有的交互动态,而无需额外的标注或固定数量的参与者。我们的主要贡献如下:

- • 我们引入了**轮次转换熵**,这是一个捕捉多方对话中轮次转换动态的自监督连续目标。
- • 我们评估了轮次转换熵作为微调多方意图识别模型辅助任务的实际用途。

## 2 相关工作

意图检测在双人对话中已被广泛研究 (Wang et al., 2023) (https://arxiv.org/html/2608.28926#bib.bib17); (Gautam et al., 2024) (https://arxiv.org/html/2608.28926#bib.bib18); (Benayas et al., 2025) (https://arxiv.org/html/2608.28926#bib.bib19)。最近,LLMs 在单轮 (Sali and Toraman, 2025) (https://arxiv.org/html/2608.28926#bib.bib25); (Castillo-López et al., 2026) (https://arxiv.org/html/2608.28926#bib.bib34); (Arora et al., 2024) (https://arxiv.org/html/2608.28926#bib.bib24) 和多轮对话 (Liu et al., 2026a) (https://arxiv.org/html/2608.28926#bib.bib28) 中的意图识别应用受到了关注。多任务学习方法提出了整合辅助任务,如命名实体识别 (Perdana et al., 2025) (https://arxiv.org/html/2608.28926#bib.bib33); (Benayas et al., 2021) (https://arxiv.org/html/2608.28926#bib.bib31)、对话行为分类 (Firdaus et al., 2021) (https://arxiv.org/html/2608.28926#bib.bib26) 和槽填充 (He et al., 2021b) (https://arxiv.org/html/2608.28926#bib.bib30); (Firdaus et al., 2023) (https://arxiv.org/html/2608.28926#bib.bib32)。然而,这些多任务方法需要额外的标注,这在许多实际应用中不可行。(Castillo-López et al., 2025b) (https://arxiv.org/html/2608.28926#bib.bib36) 提出了一种混合方法,结合小型和大型语言模型在 MPCs 的少样本设置中工作。MPCs 中的多模态融合方法也得到了研究 (Chen et al., 2024) (https://arxiv.org/html/2608.28926#bib.bib20); (Shen et al., 2025) (https://arxiv.org/html/2608.28926#bib.bib21)。然而,这些工作都没有明确旨在捕捉固有的多方行为。

对话行为分类(一个类似的、在话语级别的对话多类分类任务)的研究探索了多方性建模 (Anwar et al., 2024) (https://arxiv.org/html/2608.28926#bib.bib29)。大多数研究探讨了建模与说话人相关的动态以改进对话理解 (Fu et al., 2025) (https://arxiv.org/html/2608.28926#bib.bib27)。(He et al., 2021c) (https://arxiv.org/html/2608.28926#bib.bib22) 通过在话语表示的上下文编码之前添加说话人-轮次嵌入来解决此任务。这种机制有效地发出了说话人切换或继续的信号,但将说话人身份简化为二进制模式会以牺牲保留特定说话人的轮次转换信息为代价。这种在 MPCs 中影响最大的局限性被 (Qamar et al., 2023) (https://arxiv.org/html/2608.28926#bib.bib23) 所解决,他们提出了一个用于多方对话行为分类的特定说话人的图模型。他们的方法从说话人-话语连接中学习图结构的说话人表示,并将其与上下文话语表示连接以建模局部说话人行为。然而,这使得说话人建模依赖于每个对话的显式说话人-话语图神经模块。此外,它主要捕捉局部说话人行为,而非轮次转换的全局分布结构。

与之前的研究相反,我们通过自监督多任务策略将轮次转换动态融入多方意图识别。也就是说,不需要额外的、成本高昂的标注。此外,我们的方法不依赖于固定数量的说话人。我们引入轮次转换熵作为辅助回归信号,而不是使用说话人-轮次嵌入或图派生的说话人表示,鼓励基于 Transformer 的模型在优化主要意图分类目标的同时,捕捉说话人转换的结构。

## 3 实验流程

设 \(\mathcal{D}\) 是一个多轮对话数据集,其中每个对话 \(d_k = \{(u_i, p_i, y_i)\}_{i=1}^{n_k}\) 是一个包含 \(n_k\) 个话语的序列,\(u_i\) 表示第 \(i\) 个话语,\(p_i \in \mathcal{P}_k\) 是其来自对话特定参与者集 \(\mathcal{P}_k\) 的说话人,\(y_i \in \mathcal{Y}\) 是其意图标签。\(\mathcal{Y} = \{1, \dots, m\}\) 表示预定义的 \(m\) 个意图标签集合。我们的目标是构建一个多类分类系统,将每个话语 \(u_i\) 分配到其对应的意图 \(y_i \in \mathcal{Y}\)。我们的贡献在于利用 \(\mathcal{P}_k\) 中说话人之间的对话交互。

### 3.1 话语建模

我们使用三个不同的编码器来表示话语中的文本:BERT (Devlin et al., 2019) (https://arxiv.org/html/2608.28926#bib.bib43)、RoBERTa (Liu et al., 2019) (https://arxiv.org/html/2608.28926#bib.bib45) 和 DeBERTaV3 (He et al., 2021a) (https://arxiv.org/html/2608.28926#bib.bib46)。我们使用所有预训练模型的大型版本。关于所用模型的更多细节包含在附录 B.1 (https://arxiv.org/html/2608.28926#A2.SS1) 中。除了待分类的话语外,与之前的工作一致,我们将先前话语的编码表示前置以包含上下文信息。

### 3.2 上下文信息建模

我们向编码后的文本表示中添加额外的可学习嵌入,以整合上下文信息。遵循 (Zhang et al., 2024) (https://arxiv.org/html/2608.28926#bib.bib37),我们添加分段嵌入,让模型区分上下文话语和待分类的目标话语 \(u_t\)。在 (Zhang et al., 2024) (https://arxiv.org/html/2608.28926#bib.bib37) 中,仅将目标说话人 \(p_t\) 之前产生的话语作为上下文前置。然而,我们发现将所有先前话语作为上下文(无论其说话人是谁)时性能会提高。为了补偿这种更广泛上下文带来的说话人身份信息的丢失,我们引入了一个额外的说话人嵌入,以区分由目标说话人 \(p_t\) 产生的话语和其他参与者产生的话语。展示此修改优势的实验描述在附录 D (https://arxiv.org/html/2608.28926#A4) 中。最终输入表示和我们的架构概览如图 2 (https://arxiv.org/html/2608.28926#S3.F2) 所示。

图 2:我们的多任务学习方法架构概览。输入表示包括模型分词嵌入;用于区分上下文话语和目标话语(即最新轮次的话语,需分类到任何意图)的分段 ID;以及用于区分由产生目标话语的说话人说出的上下文的说话人嵌入。
### 3.3 轮次转换熵辅助任务

在多方对话中,参与者交替进行轮次转换的方式可能携带着关于对话性质的隐含结构信息。为了捕捉这一点,我们引入了**轮次转换熵**,这是一个连续度量,用于表征对话中说话人转换的分布。给定一个对话 \(d_k = \{(u_i, p_i, y_i)\}_{i=1}^{n_k}\),我们为目标话语 \(u_t\) 定义观察到的轮次转换对集合:

\[
\mathcal{A}_t = \{(p_{i-1}, p_i) \mid i=1, \dots, t\}
\]
(1)

其中每个对 \((p_{i-1}, p_i)\) 表示从话语 \(u_{i-1}\) 的说话人到话语 \(u_i\) 的说话人的转换。令 \(\mathcal{A}_t^*\) 表示在 \(\mathcal{A}_t\) 中观察到的唯一转换对集合,\(c(a)\) 表示对 \(a \in \mathcal{A}_t^*\) 在 \(\mathcal{A}_t\) 中出现的次数。每个观察到的轮次转换的概率估计为:

\[
P(a) = \frac{c(a)}{|\mathcal{A}_t|}
\]
(2)

目标话语 \(u_t\) 的轮次转换熵定义为观察到的转换对上的香农熵 (Shannon, 1948) (https://arxiv.org/html/2608.28926#bib.bib11):

\[
H_t = - \sum_{a \in \mathcal{A}_t^*} P(a) \log P(a)
\]
(3)

因此,我们为每个话语获得一个计算得到的连续值。与说话人计数或轮次计数统计不同,\(H_t\) 反映了直到第 \(t\) 轮观察到的轮次转换在各对之间的分布均匀程度。低熵表示有序的轮次转换顺序(即少数转换占主导地位),而高熵则反映了更多样化的轮次转换集,即更不可预测的按说话人划分的轮次转换。我们提议将定义的熵值作为多任务学习框架中的辅助回归目标,与主要的意图分类任务一起使用,以利用对话的多方特性作为额外信息来源,鼓励模型捕获轮次转换动态以改进意图分类。计算得到的熵值分布如图 3 (https://arxiv.org/html/2608.28926#S3.F3) 所示。

最后,我们提出所提议的轮次转换熵变量可能与话语属性(如轮次索引、上下文长度和说话人数量)相关。这可能会让人不清楚模型是捕捉了轮次转换的可预测性还是更简单的对话属性。因此,我们提出了辅助变量的归一化版本。具体而言,**归一化轮次转换熵**变量是通过将实际熵值除以在上下文话语中观察到的说话人数量而获得的。因此,我们同时在**轮次转换熵**和**归一化轮次转换熵**变量上进行多任务学习实验。在附录 A (https://arxiv.org/html/2608.28926#A1) 中,我们对辅助目标与先前列举的话语属性之间进行了关系分析。

图 3:在 MIntRec2.0 和 MPGT 训练集上计算的熵分布。
### 3.4 意图分类

我们考虑两种用于意图分类任务的学习方法:单任务(我们的基线)和多任务设置。

#### 单任务。

在单任务设置中,分类头由一个线性层

相似文章

令牌统计揭示多轮大语言模型交互中的对话漂移

arXiv cs.CL

本文提出双可预测性(P)和信息数字孪生(IDT),一种使用令牌频率统计来监控多轮LLM交互中对话一致性的轻量级方法,无需使用嵌入或模型内部信息。该方法在检测矛盾和话题转换时达到100%的敏感度,同时为扩展LLM部署建立了实用的监控框架。