一种基于MiniLM嵌入的离域意图检测多簇边界学习方法

arXiv cs.CL 论文

摘要

本文提出了一种基于MiniLM嵌入的多簇边界学习方法用于离域意图检测,在CLINC150、StackOverflow和Banking77数据集上取得了最先进的性能。

arXiv:2607.07974v1 公告类型: 新 摘要: 意图检测是人机交互系统中连接人类意图与系统动作的关键任务。然而,离域意图检测仍存在挑战。(i) 传统方法将离域意图检测视为多类分类,但随着已知意图类别数量的增加,检测准确率下降;(ii) 大型语言模型嵌入方法需要大量参数,导致训练和实际部署困难。因此,本文提出了一种基于MiniLM嵌入(即all-MiniLM-L6-v2)的多簇边界学习方法,采用单类分类工作流检测离域意图。该方法从训练语句中学习MiniLM生成的多簇嵌入边界,并将域外语句作为离域意图拒绝。实验在公开的CLINC150、StackOverflow和Banking77数据集上进行。结果表明,与其他基线方法相比,该方法实现了最先进的离域意图检测性能。消融研究也表明,所使用的MiniLM能更好地适应工作流和语句嵌入需求。代码可在补充材料中获取。
查看原文
查看缓存全文

缓存时间: 2026/07/10 06:11

# 基于 MiniLM 嵌入的多聚类边界学习方法用于超出范围意图检测
来源:https://arxiv.org/html/2607.07974
徐一鸿¹,康明宇¹,吕琳媛¹¹¹footnotemark:1 ¹中国科学技术大学,合肥,中国 xuyihong@mail\.ustc\.edu\.cn \{kangmingyu, linyuan\.lv\}@ustc\.edu\.cn

###### 摘要

意图检测是连接人类意图与系统动作的关键任务,在人机交互系统中至关重要。然而,检测超出范围(OOS)意图仍存在挑战。(i) 传统方法将 OOS 意图检测视为多类分类问题,随着已知意图类别数量的增加,检测精度会下降;(ii) 大语言模型(LLM)嵌入方法需要大量参数,难以训练和实际部署。为此,本文提出一种基于 MiniLM 嵌入(即 all-MiniLM-L6-v2)的多聚类边界学习方法,以一类分类的工作流程检测 OOS 意图。该方法学习 MiniLM 从训练话语中生成的多聚类嵌入的边界,然后将域外话语作为 OOS 意图拒绝。在公开的 CLINC150、StackOverflow 和 Banking77 数据集上进行了实验。结果表明,与其他基线方法相比,该方法在 OOS 意图检测上达到了最先进的性能。还进行了消融实验,结果表明所使用的 MiniLM 能更好地适应工作流程和话语嵌入需求。代码可在补充材料中获取。

基于 MiniLM 嵌入的多聚类边界学习方法用于超出范围意图检测

## 1 引言

意图检测是人机交互系统中一项关键且具有挑战性的任务。它将用户话语映射到系统动作,从而连接人类意图与系统行为 (Tur et al., 2010 (https://arxiv.org/html/2607.07974#bib.bib6); Louvan and Magnini, 2020 (https://arxiv.org/html/2607.07974#bib.bib3); Wölflein et al., 2025 (https://arxiv.org/html/2607.07974#bib.bib30))。然而,人类意图是复杂的,无法在封闭集意图检测系统中完全枚举。这意味着,如果系统接收到超出范围(OOS)意图的话语但未能拒绝,将触发错误的动作并导致有害后果,如图 1 (https://arxiv.org/html/2607.07974#S1.F1) 所示。因此,一个更重要且困难的任务是及时检测并拒绝 OOS 意图,这实际上是一个开放意图检测任务 (Hoffman et al., 2024 (https://arxiv.org/html/2607.07974#bib.bib28); Muzahid et al., 2024 (https://arxiv.org/html/2607.07974#bib.bib29))。

参照图注图 1:OOS 意图检测示意图目前存在三种类型的意图检测方法,包括统计方法、深度学习方法和 LLM 嵌入方法。其中,统计方法将意图检测视为一个监督文本分类问题。这些方法将手工设计的词汇特征与传统的统计分类器相结合,例如支持向量机 (Haffner et al., 2003 (https://arxiv.org/html/2607.07974#bib.bib7)) 和朴素贝叶斯分类器 (Schuurmans and Frasincar, 2020 (https://arxiv.org/html/2607.07974#bib.bib8))。而深度学习方法使用深度神经网络,例如卷积神经网络 (CNN) (Kim, 2014 (https://arxiv.org/html/2607.07974#bib.bib32))、循环神经网络 (RNN) (Liu and Lane, 2016 (https://arxiv.org/html/2607.07974#bib.bib33)) 和 Transformer 网络 (Vaswani et al., 2017 (https://arxiv.org/html/2607.07974#bib.bib34)),通过语义特征提取来执行意图检测。早期的深度学习分类器在封闭集模式下训练,然后将未知的域外话语识别为已知意图 (Hendrycks and Gimpel, 2017 (https://arxiv.org/html/2607.07974#bib.bib10); Guo et al., 2017 (https://arxiv.org/html/2607.07974#bib.bib11))。因此,进一步提出了几种开放意图检测方法,用于安全地拒绝包含 OOS 意图的未知话语,包括类级开放分类方法 (Shu et al., 2017 (https://arxiv.org/html/2607.07974#bib.bib13))、基于距离的评分方法 (Lee et al., 2018 (https://arxiv.org/html/2607.07974#bib.bib16))、对比表示学习方法 (Zeng et al., 2021 (https://arxiv.org/html/2607.07974#bib.bib18)) 和自适应边界学习方法 (Zhang et al., 2021 (https://arxiv.org/html/2607.07974#bib.bib19))。之后,凭借 LLM 强大的语义表示能力,人们提出了 LLM 嵌入方法,通过语义嵌入、基于提示的推理和不确定性感知的智能体路由来提取话语特征 (Arora et al., 2024 (https://arxiv.org/html/2607.07974#bib.bib31))。

然而,现有方法仍面临两个局限。首先,与已知意图语义相似的 OOS 查询容易落入已知意图的决策区域中 (Li et al., 2025 (https://arxiv.org/html/2607.07974#bib.bib21)),但事实上它们是 OOS。因此,如果将 OOS 标签混入已知意图标签,并简单地将 OOS 意图检测视为多类分类,则 OOS 拒绝的准确率会随着类别数量的增加而下降。其次,尽管 LLM 嵌入方法提高了语义理解能力,但它们仍然需要非常大的参数量,这导致了显著的计算成本和对提示设计的高度敏感性 (Zaera et al., 2025 (https://arxiv.org/html/2607.07974#bib.bib23))。因此,它们难以在资源受限的实时对话系统中训练和部署。

为解决这些局限,本文提出了一种基于级联工作流程的 OOS 意图检测多聚类边界学习方法。该工作流程将复杂的开放意图检测问题解耦为多个更简单的阶段。这使得工作流程能够使用轻量级的 MiniLM 而非具有大规模参数的 LLM。此外,它将 OOS 意图检测简化为一类分类,而非复杂的多类分类。而且,我们发现 MiniLM 可以将观测数据嵌入到多个聚类中。因此,如果学会了聚类的边界,就可以将域外话语识别为 OOS 意图。

因此,主要贡献如下:

1. 1.提出了一种多聚类边界学习方法。该方法学习 MiniLM 从训练话语中生成的多聚类嵌入的边界,然后将域外话语作为 OOS 意图拒绝。
2. 2.提出了一种级联工作流程,首先将 OOS 意图检测作为一类分类进行,然后将已知意图检测作为封闭集多类分类进行。这意味着 OOS 意图检测任务可以独立处理。
3. 3.在公开的真实世界数据集上进行了 OOS 意图检测任务的实验。结果表明,该方法在 OOS 意图检测上达到了最先进的性能。此外,还进行了消融实验,结果表明所使用的 MiniLM,即 all-MiniLM-L6-v2,能更好地适应工作流程和话语嵌入需求。

## 2 相关工作

开放意图检测方法主要可以分为三类,即统计方法、深度学习方法和 LLM 嵌入方法,具体取决于问题设置和分类器的类型。

### 2.1 意图检测的统计方法

统计方法使用手工设计的词汇特征与统计分类器来检测意图类别。其中,Wang 等人 (2002 (https://arxiv.org/html/2607.07974#bib.bib5)) 提出了一种将基于规则的语法与统计分类器相结合的方法,但语法必须为每个领域手工构建。为减少这种依赖,Haffner 等人 (2003 (https://arxiv.org/html/2607.07974#bib.bib7)) 使用支持向量机作为判别模型,在意图分类上表现出色,且无需基于规则的组件。但这些方法仍然依赖于手工设计的特征。因此,Tur 等人 (2010 (https://arxiv.org/html/2607.07974#bib.bib6)) 提出了一种 n-gram 方法来建模局部上下文依赖关系,但特征稀疏性限制了其在多样化意图表达上的有效性。随后,Schuurmans 和 Frasincar (2020 (https://arxiv.org/html/2607.07974#bib.bib8)) 比较了这些方法,并表明密集词嵌入在意图分类上优于稀疏特征。

### 2.2 意图检测的深度学习方法

随后,深度学习方法使用人工神经网络来参数化意图分类器并学习密集的语义表示。例如,CNN 用于从词嵌入中提取局部语义模式 (Kim, 2014 (https://arxiv.org/html/2607.07974#bib.bib32)),RNN 用于捕获顺序依赖关系,以进行联合意图检测和槽填充 (Liu and Lane, 2016 (https://arxiv.org/html/2607.07974#bib.bib33))。此外,Transformer 模型通过自注意力机制直接捕获全局语义依赖关系 (Vaswani et al., 2017 (https://arxiv.org/html/2607.07974#bib.bib34))。这些方法提高了分布内准确率,但分类模式仍然是封闭集,分类器只能识别具有已知意图标签的未知话语,无法拒绝 OOS 意图 (Hendrycks and Gimpel, 2017 (https://arxiv.org/html/2607.07974#bib.bib10); Guo et al., 2017 (https://arxiv.org/html/2607.07974#bib.bib11))。

因此,为了拒绝 OOS 意图,有几种方法将 OOS 意图检测视为开放集分类任务。例如,Hendrycks 和 Gimpel (2017 (https://arxiv.org/html/2607.07974#bib.bib10)) 设置了一个额外的 OOS 类别,将开放集分类转化为封闭集分类。然后,该方法通过 softmax 概率为每个类别分配常规分数。此外,Lee 等人 (2018 (https://arxiv.org/html/2607.07974#bib.bib16)) 提出了基于马氏距离的评分方法,将分数建模为类条件高斯分布。但这些分数假设通常违反现实世界的类别分布。而且,随着类别数量的增加,OOS 标签与许多已知意图标签耦合,导致 OOS 类别的分数被稀释,准确率下降。为提高表示的可分离性,Zeng 等人 (2021 (https://arxiv.org/html/2607.07974#bib.bib18)) 提出了有监督对比学习,学习判别性嵌入以更好地区分意图类别。但这仍然只带来了有限的改进。

随后,Shu 等人 (2017 (https://arxiv.org/html/2607.07974#bib.bib13)) 放弃了这种转换,提出了一种开放分类方法。该方法用一对多的 sigmoid 分类器替换 softmax 概率,然后计算类级拒绝阈值。如果 softmax 分数超过阈值,则输入话语将被拒绝。接着,Zhang 等人 (2021 (https://arxiv.org/html/2607.07974#bib.bib19)) 提出了一种决策边界学习方法,从所有嵌入的已知意图中学习一个边界,外部区域为 OOS。但该方法只能为每个意图学习一个单一的质心。实际上,根据我们的观察,嵌入通常具有多个质心。随后,Li 等人 (2025 (https://arxiv.org/html/2607.07974#bib.bib21)) 提出了一种多粒度边界学习方法,为每个意图学习多个边界。

### 2.3 意图检测的 LLM 嵌入方法

随着 LLM 技术的发展,LLM 嵌入方法被提出,通过多智能体路由模式来加强用户话语的语义表示和特征嵌入。其中,Arora 等人 (2024 (https://arxiv.org/html/2607.07974#bib.bib31)) 提出了一种混合方法,使用 Sentence Transformer 将不确定的意图预测路由到指定的 LLM。但该 LLM 仅针对不确定查询设计,并未针对 OOS 查询进行训练。随后,Zaera 等人 (2025 (https://arxiv.org/html/2607.07974#bib.bib23)) 提出了一种不确定性感知路由方法,仅根据 Monte Carlo dropout 准则触发微调后的 LLM。但如果存在分布漂移,路由决策仍不稳定。而且,多智能体 LLM 需要大量的计算成本,难以在实际应用中部署。此外,Chen 和 Wang (2025 (https://arxiv.org/html/2607.07974#bib.bib35)) 提出了一种小-大模型协作方法用于少样本意图检测。该方法在预训练期间使用 LLM 生成 OOS 话语并进行数据扩充,然后使用较小的深度学习模型来实现意图检测。

因此,现有方法仍面临两个问题:(i) OOS 意图检测通常被视为多类分类,难以与已知意图检测分离。(ii) 多智能体 LLM 需要非常大的计算成本。并且由于原因 (i),当前的路由机制不准确。

## 3 方法

### 3.1 级联工作流程用于意图检测

所提出的方法采用三级级联:门控→路由→专家,如图 2 (https://arxiv.org/html/2607.07974#S3.F2) 所示。给定输入话语 \(x\),门控模块首先判断是否 OOS 拒绝。如果 \(x\) 被拒绝,门控模块输出 OOS 标签;否则,\(x\) 被输入后续模块。然后,路由模块判别剩余已知意图的粗粒度类别领域。随后,话语 \(x\) 被传递到相应领域的专家模块,用于少数类别的细粒度判别。注意,由于已知意图分类是封闭集的,所有训练意图都是已知的,因此路由器和专家均由 SmolLM-135M 参数化,该模型通过低秩适配 (LoRA) (Hu et al., 2022 (https://arxiv.org/html/2607.07974#bib.bib36)) 技术在已知意图的观测数据上进行有监督微调。

参照图注图 2:基于 MiniLM 多聚类边界学习的级联工作流程概述对于输入话语 \(x\),门控 \(G(\cdot)\) 首先检查 \(x\) 是否为 OOS:

\[ z = G(x), \quad z \in \{\mathrm{ID}, \mathrm{OOS}\}, \tag{1} \]

其中 \(z\) 是二元决策,\(\mathrm{ID}\) 表示输入在分布内,\(\mathrm{OOS}\) 表示输入超出范围。如果 \(z = \mathrm{OOS}\),则返回 OOS 标签。否则,路由 \(R(\cdot)\) 预测领域:

\[ d = R(x), \quad d \in \mathcal{D}, \tag{2} \]

其中 \(\mathcal{D}\) 是领域集合。然后专家 \(E_d(\cdot)\) 对意图进行分类:

\[ y = E_d(x), \quad y \in \mathcal{Y}_d \subseteq \mathcal{Y}_{\mathrm{ID}}, \tag{3} \]

其中 \(\mathcal{Y}_{\mathrm{ID}}\) 是已知意图标签集,\(\mathcal{Y}_d\) 是领域 \(d\) 的意图子集。

所提出的级联工作流程将 OOS 检测与已知意图分类分离开来。每个模块处理一个更简单的子任务,从而降低了复杂性。因此,门控只需要判断输入是否属于已知意图空间。这样,一个轻量级模型就足够了。

### 3.2 基于 MiniLM 的意图嵌入

由于门控仅需区分 OOS 与已知意图样本,因此使用轻量级 MiniLM 编码器 all-MiniLM-L6-v2 来构建语义表示空间。MiniLM 将每个输入话语 \(x\) 映射到固定维度的嵌入:

\[ e = f_\theta(x), \quad e \in \mathbb{R}^h, \tag{4} \]

相似文章

MAG:流形引导的半监督多模态上下文学习

arXiv cs.LG

本文介绍了MAG,一种流形引导的半监督多模态上下文示例选择框架,利用未标记数据改进多模态大语言模型的少样本上下文学习。在八个基准上的实验表明,在标签稀缺场景下取得了一致的性能提升。

面向多模态情感分析的语义对齐结构抽象

arXiv cs.CL

本文提出了SentiLLM,一个利用语义对齐结构抽象将非语言模态提炼为类文本标记的框架,用于基于大语言模型的多模态情感分析。它引入了一种双流显著性-上下文校准机制,并在四个数据集上取得了优越的性能。

上下文学习运作于概念子空间学习

arXiv cs.LG

本文提出,大型语言模型中的上下文学习通过低维概念子空间运作,任务相关信息集中在表示空间的一小部分中,并在Llama-3-8B和Qwen2.5-7B上通过实验得到支持。