选择开放权重语言模型进行零样本意图分类:41个模型的系统评估

arXiv cs.CL 论文

摘要

本文系统评估了41个开放权重语言模型(135M–9B)在8个数据集上的零样本意图分类性能,分析了准确性、校准、鲁棒性和部署效率。研究发现,经过指令调优的3B模型可以胜过7B基础模型,并且像SNIPS这样的一些基准已经饱和。

arXiv:2607.27421v1 公告类型:新 摘要:意图分类是面向任务的对话系统的核心组成部分,但从业者在计算、延迟和鲁棒性约束下选择可部署的开放权重语言模型时,缺乏系统性的指导。我们对41个开放权重语言模型进行了系统的零样本评估,这些模型涵盖15个系列,参数量范围为135M--9B,涉及八个英文单标签意图分类数据集。第九个数据集ATIS使用五个带标签的示例,作为辅助的五样本结果报告。评估包括标准基准、大规模语音助手语料库以及来自生产环境的电子商务数据集。除了精确匹配准确率外,我们还分析了置信度校准、对现实输入扰动的鲁棒性、模型排名的统计可靠性、部署效率和基准饱和性。我们的结果表明,经过指令调优的3B模型可以胜过几个被评估的7B基础模型;在MASSIVE上,领先模型之间的差异在配对McNemar检验下在统计上无法区分;并且像SNIPS这样广泛使用的基准已经饱和,不再能有效区分当前的开放权重模型。指令调优对置信度校准的影响不一致,而不是普遍有害。这些发现为选择和评估用于意图分类的开放权重语言模型提供了实用指导。
查看原文
查看缓存全文

缓存时间: 2026/07/31 10:01

# 为零样本意图分类选择开放权重语言模型:对 41 个模型的系统评估

来源:https://arxiv.org/html/2607.27421

###### 摘要

意图分类是任务型对话系统的核心组成部分,但在计算、延迟和鲁棒性约束下,实践者缺乏系统性的指导来选择可部署的开放权重语言模型。我们对 41 个开放权重语言模型进行了系统的零样本评估,涵盖 15 个模型家族和 135M–9B 参数范围,跨越八个英文单标签意图分类数据集(第九个数据集 ATIS 使用五个带标签的示例,作为辅助的五样本结果报告),包括标准基准、大规模语音助手语料库以及生产环境衍生的电子商务数据集。除精确匹配准确率外,我们还分析了置信度校准、对真实输入扰动的鲁棒性、模型排名的统计可靠性、部署效率以及基准饱和情况。结果表明,经过指令微调的 3B 模型可以超越若干被评估的 7B 基础模型;在配对 McNemar 检验下,MASSIVE 上领先模型之间的差异在统计上无法区分;而 SNIPS 等广泛使用的基准已经饱和,不再能有效区分当前的开放权重模型。指令微调对置信度校准的影响是不一致的,而非一概有害。这些发现为选择和评估用于意图分类的开放权重语言模型提供了实用指导。

## 引言

意图分类(IC)——将自然语言话语映射到预定义功能类别的任务——是任务型对话系统的核心组成部分[19 (https://arxiv.org/html/2607.27421#bib.bib19),8 (https://arxiv.org/html/2607.27421#bib.bib8)]。当用户说“设置早上 7 点的闹钟”时,系统必须在任何下游响应生成之前将其正确映射到 `alarm_set`。这种映射支撑着几乎所有大规模部署的语音助手、客户支持代理和对话式 AI 系统。随着大型语言模型(LLM)日趋成熟,零样本 IC 变得越来越有吸引力[6 (https://arxiv.org/html/2607.27421#bib.bib6),28 (https://arxiv.org/html/2607.27421#bib.bib28)]:一个通用的单模型,通过提示提供标签集和用户话语,即可在无需任何任务特定训练数据的情况下执行 IC。这提出了一个实践者真正关心但收到的系统性关注却少得惊人的问题:在实践者实际部署的 135M–9B 参数范围内的数十种开放权重 LLM 中,*应该选择哪一个,以及为什么?* 当前最先进水平在这方面提供的指导有限。IntentGrasp[32 (https://arxiv.org/html/2607.27421#bib.bib32)] 是最近最全面的评估,它将 49 个意图相关数据集重构为多项选择问答,并同时评估了专有前沿模型(GPT-5、Gemini-3、Claude-4)和开放权重模型——这一设置与大多数真实部署决策所处的计算受限、延迟敏感环境相去甚远。据我们所知,先前工作尚未针对面向部署的单标签零样本 IC 系统性地评估开放权重 sub-9B 空间。我们直接填补了这一空白。我们评估了 41 个开放权重 LLM,涵盖 15 个模型家族(135M–9B 参数),在 8 个零样本意图分类数据集上(外加 ATIS 作为 5 样本辅助结果;见总体模型排名小节),横跨学术基准、大规模语音助手语料库和真实电子商务部署数据。我们的评估超越了准确率,还包括置信度校准(ECE、Brier Score)、对输入噪声的鲁棒性、排名的统计显著性和部署效率,全部为零样本且无任务特定微调(ATIS 除外)。我们运行的全部九个数据集遵循任务型对话中标准的单标签分类范式;多标签意图检测[24 (https://arxiv.org/html/2607.27421#bib.bib24)]不在我们的范围内。

贡献:
(1) 首次对 41 个开放权重 LLM(15 个家族,135M–9B)在 8 个零样本 IC 数据集上进行系统评估。
(2) 在 MASSIVE 上的置信区间和 McNemar 检验表明,前五名模型之间的观测差异在统计上不显著。
(3) 针对 IC 场景下开放权重 LLM 的校准分析,限定于 MASSIVE 的紧凑标签空间和自由文本生成,表明指令微调对校准的影响不一致而非一概有害。
(4) 鲁棒性分析表明,在所评估的扰动种子下,Qwen2.5-7B-Instruct 具有最低的观测错别字引起的性能下降。
(5) 基准饱和分析建议在 IC 评估套件中降低对 SNIPS 的重视。

## 相关工作

意图分类基准跨越了三十年,从 ATIS[14 (https://arxiv.org/html/2607.27421#bib.bib14)] 和 SNIPS[9 (https://arxiv.org/html/2607.27421#bib.bib9)] 到 CLINC150[19 (https://arxiv.org/html/2607.27421#bib.bib19)]、Banking77[8 (https://arxiv.org/html/2607.27421#bib.bib8)] 和 MASSIVE[11 (https://arxiv.org/html/2607.27421#bib.bib11)] 等大规模语料库,HINT3[22 (https://arxiv.org/html/2607.27421#bib.bib22)] 引入了生产环境电子商务数据集,以揭示学术基准与部署现实之间的差距;Larson 和 Leach[18 (https://arxiv.org/html/2607.27421#bib.bib18)] 调研了这一领域,并指出日益增长的饱和问题,我们的分析证实并扩展了这一点。零样本分类随模型规模和指令微调而不断改进[6 (https://arxiv.org/html/2607.27421#bib.bib6),28 (https://arxiv.org/html/2607.27421#bib.bib28),25 (https://arxiv.org/html/2607.27421#bib.bib25)],Mehri 和 Eric[21 (https://arxiv.org/html/2607.27421#bib.bib21)] 表明预训练 LM 可以直接执行零样本意图检测。与我们的设置最接近的是 Park 等人[23 (https://arxiv.org/html/2607.27421#bib.bib23)],他们在我们使用的相同 HINT3 数据集上评估了相似规模的 Qwen2.5-1.5B/7B-Instruct 和 Llama3-8B-Instruct,但采用的是 10 样本机制并带有 LLM 驱动的标签细化,而非真正的零样本;他们发现 Powerplay11 从标签澄清中获益最多的结果与我们自身的发现一致,即 Powerplay11 是我们零样本套件中最难的数据集(平均准确率和最佳模型准确率均最低;见基准饱和分析)。最全面的近期基准 IntentGrasp[32 (https://arxiv.org/html/2607.27421#bib.bib32)] 以多项选择问答的形式评估了 20 个前沿 LLM 在 49 个重格式化数据集上的表现;ConsintBench[20 (https://arxiv.org/html/2607.27421#bib.bib20)] 和 SessionIntentBench[31 (https://arxiv.org/html/2607.27421#bib.bib31)] 涉及电子商务和会话级意图,但其底层数据集不公开。我们的工作是互补性的,侧重于开放权重 sub-9B 模型,并提供了先前基准所缺少的面向部署的分析(校准、鲁棒性、效率、排序可靠性)。现代神经网络中的校准失败已有充分记录[13 (https://arxiv.org/html/2607.27421#bib.bib13),35 (https://arxiv.org/html/2607.27421#bib.bib35)],但针对开放权重 LLM 在 IC 上指令微调对校准的影响受到的关注有限,我们对此进行了直接研究。关于相关工作的扩展讨论,包括额外引用和与每个先前基准的更详细比较,见补充材料。

## 数据集

我们评估了九个单标签意图分类数据集,这些数据集涵盖了广泛的领域、标签空间大小和收集设置;其中八个在所有总分、排名和本文比较中均以零样本方式使用,第九个(ATIS)作为 5 样本辅助结果单独报告(总体模型排名小节)。SGD 被排除,因为其单轮输入缺少可靠意图信号所需的对话上下文。表 1 (https://arxiv.org/html/2607.27421#Sx3.T1) 展示了完整的数据集统计信息。该套件包括四个标准学术基准(CLINC150、Banking77、ATIS、SNIPS;ATIS 为 5 样本,其他三个为零样本)、一个大规模语音助手生产语料库(MASSIVE)、一个分层解析基准(MTOP),以及来自 HINT3 语料库[22 (https://arxiv.org/html/2607.27421#bib.bib22)] 的三个真实电子商务生产数据集,它们代表了真实的部署条件。对于每个数据集,我们评估前 500 个测试示例,按索引确定性选择(补充材料),但有一个例外:三个 HINT3 数据集使用其完整测试集(Curekart、Powerplay11 和 Sofmattress 分别为 459、309 和 253 个示例)。

表 1:数据集统计。Avg Acc = 在每种数据集报告的提示协议(数据集部分)下评估的模型队列的平均准确率;所有 41 个模型均已完成 MASSIVE 推理。ATIS† 按五样本评估,并排除在所有零样本总分和排名之外;其他八个数据集为零样本。Len = 平均话语词数。所有数据集均遵循单标签分类范式。

## 评估框架

#### 模型。
我们评估了 41 个开放权重 LLM,涵盖 15 个模型家族,参数范围从 135M 到 9B,每个家族对应一个不同的模型开发者/架构谱系:Qwen2/2.5[29 (https://arxiv.org/html/2607.27421#bib.bib29),30 (https://arxiv.org/html/2607.27421#bib.bib30)]、Llama 3/3.1/3.2[12 (https://arxiv.org/html/2607.27421#bib.bib12)]、Mistral[16 (https://arxiv.org/html/2607.27421#bib.bib16)]、Yi[33 (https://arxiv.org/html/2607.27421#bib.bib33)]、Phi[1 (https://arxiv.org/html/2607.27421#bib.bib1)]、InternLM2[7 (https://arxiv.org/html/2607.27421#bib.bib7)]、DeepSeek-R1-distilled[10 (https://arxiv.org/html/2607.27421#bib.bib10)]、ChatGLM3-6B[26 (https://arxiv.org/html/2607.27421#bib.bib26)]、MiniCPM[15 (https://arxiv.org/html/2607.27421#bib.bib15)]、SmolLM2[2 (https://arxiv.org/html/2607.27421#bib.bib2)]、Pythia[4 (https://arxiv.org/html/2607.27421#bib.bib4)]、BLOOM[5 (https://arxiv.org/html/2607.27421#bib.bib5)]、StableLM[3 (https://arxiv.org/html/2607.27421#bib.bib3)]、TinyLlama[34 (https://arxiv.org/html/2607.27421#bib.bib34)] 和 GPT-J[27 (https://arxiv.org/html/2607.27421#bib.bib27)]。ChatGLM3-6B 成功完成了评估并包含在全部结果中。vLLM 不兼容架构的模型家族(Gemma-2、Falcon 和 OLMo-2,均已验证在 vLLM 0.6.3 下所有评估规模均无法加载)未被评估。所有 41 个被评估模型均有完整的主评估准确率分数。模型被分类为 *Base*(仅预训练)、*Instruct*(指令微调)或 *Reasoning*(思维链优化)。完整的排名模型列表见补充材料。

#### 推理协议。
所有模型均使用 vLLM 0.6.3[17 (https://arxiv.org/html/2607.27421#bib.bib17)] 在 NVIDIA V100-32GB GPU 上运行,采用 float16 精度、温度 0.0(贪心解码)、最大生成 20 个 token。所有九个数据集(包括 MASSIVE)均使用自由文本生成,归一化后进行精确匹配解析;我们不使用受限解码。MASSIVE 的紧凑标签空间(60 个简短、一到两个词的意图;表 1 (https://arxiv.org/html/2607.27421#Sx3.T1))仍然是我们接下来讨论的校准分析的基础。

#### 提示设计。
八个数据集使用零样本提示,包含角色描述、完整有效标签列表、输出指令和输入话语。ATIS 提示额外包含五个带标签的示例,仅作为辅助五样本评估处理。不使用思维链指令或任务特定参数调优。完整的提示模板见补充材料。

#### 评分。
主要指标是归一化后的精确匹配准确率(小写、去除冠词、去除标点)。次要指标包括期望校准误差(ECE)和用于正确性置信度的二元 Brier Score(置信度校准小节)。总分为六个数据集组的均值:标准 IC 综合(CLINC150、Banking77 和 SNIPS 的均值;ATIS 被排除在该综合以及整个总分之外,见总体模型排名小节)、MASSIVE、MTOP、Curekart、Powerplay11 和 Sofmattress。我们称之为*组平衡*总分:三个零样本学术基准被合并到一个组中,这样饱和的旧基准不会压过面向生产的数据集;因此,其余每个数据集与整个学术综合具有相同的权重。每个数据集的分数在补充材料中全部列出,以便计算替代聚合方式。

#### 为什么校准仅限于 MASSIVE。
校准需要能够代表真实标签级置信度的对数概率,而只有当生成的 token 以合理的规律性对应于有效标签时,这种概率才可解释。我们在整个过程中使用自由文本生成(见上述推理协议),因此这不是结构上保证的;这是一个我们依赖的经验性质,而非解码时的约束。MASSIVE 的标签空间短而紧凑(60 个意图,主要是一到两个词的标签,例如 `alarm query`),在实践中,这使得生成在贪心解码下与标签词汇紧密对齐,因此评估流水线返回的生成文本的序列级对数概率可以作为模型对其答案置信度的可用(即使是近似的)代理。其他八个数据集具有更长、更多样化的标签表面形式(表 1 (https://arxiv.org/html/2607.27421#Sx3.T1)),自由文本生成更常偏离标签词汇,对数概率相应地更难以解释为标签级置信度。因此,将校准限制在 MASSIVE 上是一个基于标签紧凑性的务实范围决策,而不是声称 MASSIVE 的对数概率是受限解码所能保证的那种精确标签条件概率;我们在此评估中未应用受限解码。这是校准分析的一个真实局限,在下面的局限性段落中再次提及。

## 结果与分析

### 总体模型排名

RQ-1:哪些开放权重模型在零样本 IC 准确率上表现最佳?我们评估了八个零样本意图分类数据集:CLINC150、Banking77 和 SNIPS(平均为标准 IC 综合)、MASSIVE、MTOP,以及三个 HINT3 生产数据集(Curekart、Powerplay11、Sofmattress)。第九个数据集 ATIS 在目标查询之前使用五个带标签的示例——这与本研究中的其他所有数据集不同——因此 ATIS 反映的是 5 样本上下文性能而非零样本。因此,我们将 ATIS 完全排除在总分、图 1 (https://arxiv.org/html/2607.27421#Sx5.F1)、所有排名和指令微调比较以及饱和分析之外;其 5 样本结果仅在补充材料中单独报告以供参考。另一个模型 Qwen2.5-1.5B-Instruct 被排除在本节所有 40 模型比较之外:其 Banking77 评估使用了完整测试划分,而非其他所有模型使用的先取 500 示例子集,因此不可直接比较(补充材料)。图 1 (https://arxiv.org/html/2607.27421#Sx5.F1) 展示了 40 个可比模型中按组平衡总分排名前 15 的模型。

相似文章

基于大语言模型的零样本目标识别

arXiv cs.AI

本文首次系统性地对前沿大语言模型在经典PDDL规划基准上的零样本目标识别能力进行评估,发现部分模型能随证据积累而扩展性能,而另一些模型则始终依赖世界知识先验,不受观测累积影响。

Index SLM 技术报告

arXiv cs.CL

Bilibili 发布了 Index-1.9B 系列开源小语言模型,该系列在 2.8 万亿 token 上进行了预训练,在基准测试中取得有竞争力的性能。四个模型包括基础版、纯净版(无指令数据)、聊天版以及带有检索增强生成用于角色扮演的角色版。