何时调用LLM:一种基于置信度门控的混合方法,用于对话式AI中成本高效的语义情感识别
摘要
本文提出了一种基于置信度门控的混合系统,用于对话式AI中的情感识别。该系统将大多数流量路由通过低成本集成模型,并将不确定案例升级到LLM,从而在提高准确性的同时,降低CCaaS平台的成本和延迟。
查看缓存全文
缓存时间: 2026/09/17 09:29
# 何时调用大语言模型:面向对话式AI成本效益情感识别的信心门控混合方案 来源:https://arxiv.org/html/2609.17977 ###### 摘要 对话情感识别(ERC)是联络中心即服务(CCaaS)平台中智能助手提示、升级路由和通话后分析的核心能力,其成本与延迟约束与准确性同等重要。本文对三种对话情境ERC部署方案进行了系统级对比:低成本堆叠集成模型(句子嵌入+窗口化上下文+随机森林/XGBoost/逻辑回归堆叠)、现成大语言模型提示(GPT-4o-mini;零样本/少样本/思维链),以及信心门控混合方案——该方案仅将集成模型置信度最低的预测升级至大语言模型,其设计直接借鉴了生产环境中已使用的智能助手至人工座席升级策略。在IEMOCAP数据集上,集成模型以显著低于大语言模型的成本和低于10毫秒的延迟,全面超越所有大语言模型配置(加权F1值0.595 vs. 0.460-0.536,p<0.0001);而在MELD和CMU-MOSI数据集上排名逆转,表明单一系统均非普遍适用的部署默认方案。信心门控混合方案通过在所有三个数据集上同时实现对两种纯系统的帕累托优势(加权F1值0.620、0.643、0.824),并将大部分流量导向近乎零成本的集成模型,有效解决了这一矛盾,其成本约为每百万次语音交互10-85美元,而纯大语言模型管线需99-170美元。该升级策略并非不透明的成本/精度调节器:被升级的对话轮次显著伴随情感或情绪转变,为运营人员提供了可解释、可审计的路由信号;同时集成模型的置信度经过良好校准,呈现安全的低置信倾向。该模式在三个数据集和两个独立大语言模型提供商中均保持稳定。信心门控级联本是通用机器学习系统中的成熟思路,我们的贡献在于证明其可无缝迁移至对话情境ERC,为CCaaS和对话式AI平台的分配决策提供了具体可行的部署方案。 Five9 [email protected], [email protected], [email protected], [email protected] ## 1 引言 对话情感识别(ERC)支撑着CCaaS平台中的实时智能助手提示、自动升级路由、质量保证评分及通话后分析功能。生产系统通常缺乏运行大规模序列/图ERC模型的延迟与吞吐量预算,这促使了我们先前的工作(Parida等,2023),证明了相对简单的树模型学习器堆叠集成,在IEMOCAP数据集上能以远低于复杂架构的成本达到相当效果。随着通用大语言模型成为文本分类的默认首选工具(通常通过零样本或少样本提示),一个关键部署问题浮现:现成大语言模型提示是否真正优于精心设计的轻量级集成模型?若答案取决于数据集特性,何种部署架构可避免错误选择? 上述部署选项并非仅有的两种:最先进的情境ERC架构——如EmoBERTa(Kim和Vossen,2021)、Joyful(Li等,2023)、MiSTER-E(Dutta、Balaji和Ganapathy,2026)——采用微调Transformer骨干或多模态(文本+音频+视觉)融合,涉及领域特定微调成本与超出实时p95服务等级协议预算的GPU推理延迟(§2)。我们的集成模型(§3)无需微调或GPU服务,在CPU上运行延迟低于10毫秒;大语言模型API调用虽无微调成本且无需GPU,但按调用计费并受延迟约束。因此部署选择实为三足鼎立,本文暂不讨论微调/多模态方案——其精度上限与成本特征已在ERC文献中明确(§2,附录L),仅需在无GPU服务成本的两个选项中,确定是否需要调用大语言模型,还是经过校准的轻量级集成已足够应对。 信心门控级联——让廉价模型处理大部分流量,仅在疑难案例上调用昂贵模型——是通用机器学习系统的成熟模式(Chen、Zaharia和Zou,2023;Nie等,2024)。我们的贡献不在于级联概念本身,而是证明当廉价阶段是经过校准的非大语言模型集成时,该方案可无缝迁移至对话情境ERC,并精确刻画路由器学习升级的案例特征。具体而言,我们: 1. 在IEMOCAP、MELD和CMU-MOSI数据集上,对轻量级集成模型与GPT-4o-mini的三种提示策略进行对话层级的受控比较(含配对自举显著性检验),证明单一系统在所有数据集上均非安全默认方案。 2. 识别并实证验证特定机制——思维链提示对多数类“中性”标签的系统性低估——解释了为何CoT在IEMOCAP表现最佳却在MELD表现最差(附录C)。 3. 提出并验证信心门控混合方案:基于集成模型自身的校准类别概率进行路由,在三个数据集和两个独立大语言模型提供商测试中均实现对两种纯系统的帕累托优势。 4. 证明路由器具有可解释性而非黑箱阈值:被升级的对话轮次显著伴随情感/情绪转变(提升1.11-1.17倍),且底层集成模型置信度经过良好校准,呈现安全的低置信倾向——这对生产环境升级门控而言是理想校准方向。 ## 2 相关工作 **ERC架构**。DialogueRNN(Majumder等,2019)、DialogueGCN(Ghosal等,2019)和COSMIC(Ghosal等,2020)分别通过递归、图结构和常识知识建模对话上下文。近期研究转向大型微调Transformer及多模态/大语言模型嵌入融合:EmoBERTa(Kim和Vossen,2021)、Joyful(Li等,2023)和MiSTER-E(Dutta、Balaji和Ganapathy,2026)。这些研究基于架构复杂性必然带来提升的假设相互比较,而轻量级树集成模型已被证明能以远低于该系列的成本达到相当(但非超越)的水平(Parida等,2023),但尚无已发表ERC研究比较此类集成与大语言模型提示或两者信心门控混合方案。这对CCaaS平台具有重要现实意义:递归、图及大语言模型嵌入融合架构通常需要GPU服务,且逐句延迟远超实时智能助手典型p95服务等级协议预算,因此系统基准精度仅是部署相关属性之一,还需考量训练成本、推理延迟及预测可解释性。 **大语言模型用于情感/情感分类**。多数大语言模型提示基准评估的是单句情感而非对话情境ERC。罕见的对话级例外Feng等(2024)评估零样本/少样本大语言模型提示与微调神经ERC基线,发现大语言模型普遍表现不佳——这与我们发现现成大语言模型提示未能统一超越非大语言模型ERC基线(§4)最为接近,尽管他们使用的是不同(微调型而非树集成)基线。大语言模型提示在多轮场景中也普遍性能下降(Laban等,2025),且思维链对情感任务的价值存在争议:其在部分情感分析场景有效,在其他场景无效(Zheng、Zhao和Li,2025;Miriyala、Bukkapatnam和Prahallad,2025),这映射了我们的发现:CoT在IEMOCAP是最佳策略但在MELD是最差策略。 **成本感知级联与信心路由**。该文献分三条脉络: 1. *大语言模型级联与学习路由器*评估或生成候选答案后决定是否升级:FrugalGPT(Chen、Zaharia和Zou,2023)基于学习答案质量评分进行门控;RouteLLM(Ong等,2024)从偏好数据学习胜率模型而非校准分数;AutoMix(Aggarwal等,2023)结合少样本自验证与POMDP路由器;Tryage(Hari和Thomson,2023)预测每提示的下游性能;EcoAssistant(Zhang等,2023)基于代码执行失败而非概率信号升级;Mixture-of-Agents(Wang等,2024)叠加多个大语言模型无升级决策,构成有用的对比案例。Dekoninck、Baader和Vechev(2024)从理论上形式化级联路由,证明质量估计器自身精度是级联性能的瓶颈约束——这直接支持我们基于校准良好的非大语言模型估计器进行门控的动机,而非依赖大语言模型判断。 2. 第二脉络通过信心信号将*非大语言模型*模型升级至大语言模型,架构更接近我们的设计:Nie等(2024)在通用流式推理中通过学习持续更新的延迟策略从逻辑回归延迟至大语言模型,仅将简单信心阈值延迟作为基线;Gatekeeper(Rabanser等,2025)添加校准调优损失,确保级联廉价模型仅在正确时具有高信心,直接支持我们验证的校准质量(附录G)对此设计的重要性;Confidence Tokens(Chuang等,2024)则训练大语言模型自身输出路由标记,介于前两者之间;Fanconi和van der Schaar(2025)将升级扩展为基础模型/大语言模型/人类的三层决策级联。 3. 第三条理论脉络奠定阈值延迟的基础:Fisch、Jaakkola和Barzilay(2022)形式化选择性校准误差,Hendrickx等(2021)广泛综述拒绝选项分类。我们相对于三条脉络的贡献是任务特定且架构性的:直接基于校准树集成自身的类别概率进行门控,无需学习延迟策略或大语言模型判断质量评分,可无缝迁移至对话情境ERC,在三个数据集和两个大语言模型提供商测试中实现对两种纯端点的帕累托优势,并产生可解释的升级信号——与情感/情绪转变存在适度但一致的关联(§4.4),为CCaaS部署决策提供直接成本映射——这种组合在ERC领域尚未被证实。 ## 3 方法 表1:数据集统计。IEMOCAP(Busso等,2008)将第5场次留作测试集,符合标准惯例;MELD(Poria等,2019)和CMU-MOSI(Zadeh等,2016)采用其发布的训练/测试划分。†IEMOCAP验证集非官方划分——我们从训练对话中自行划分(10%)用于开发期一致性检查。‡MELD和CMU-MOSI的验证列是各自数据集发布的开发/验证集;三个数据集的验证行均未合并至训练集或用于任何报告结果——它们仅用于诊断检查,符合这些基准的标准实践。 **集成基线**。每个话语使用预训练句子嵌入(all-MiniLM-L6-v2,384维,无微调)编码,连接前5个话语的平均嵌入及同说话者/异说话者标记,生成769维特征向量。堆叠集成的0层基学习器包括两种随机森林配置(300棵树/无限制深度/平衡类别权重;500棵树/深度20/平衡子采样权重)和两种XGBoost配置(300棵树/深度6/学习率0.1/0.8子采样;500棵树/深度4/学习率0.05/0.9子采样),原为确保集成多样性而选择。我们在附录B中通过系统超参数搜索直接验证此选择:每个数据集20次试验搜索仅将测试集加权F1提升0.17-0.78点,证实这些值已接近最优而非任意选择。1层元学习器通过5折内部交叉验证在0层折外类别概率预测上训练逻辑回归(scikit-learn StackingClassifier,stack_method="predict_proba")。集成在每个数据集的全训练划分(表1)上训练一次,并在全留出测试划分上评估一次;无需GPU,在CPU上每个话语运行延迟低于10毫秒。 **大语言模型提示**。我们评估GPT-4o-mini在零样本、少样本(6样本)和思维链(CoT,6样本)提示下的表现,使用与集成匹配的5轮上下文窗口,温度设为0,并记录每次调用的成本、延迟和token数。附录J额外评估了Llama-3-8B-Instruct在三个数据集全测试划分上的表现,作为独立第二提供商。 **信心门控混合方案**。算法1形式化了路由规则:设$p_{\max}$为集成模型的最高类别概率,$\tau \in [0,1]$为阈值。我们扫描$\tau$的$\{0.00, 0.05, \ldots, 1.00\}$取值,绘制精度-成本曲线并与两个纯端点比较($\tau=0$:纯集成;$\tau=1$:纯大语言模型),并在每个数据集经验最优$\tau^*$处报告结果。此扫描需要全标签评估集,对于全新生产数据集通常不可用;附录E提供了实用冷启动方案并在三个数据集上直接模拟。 图1:信心门控混合路由架构。堆叠集成分类器...
相似文章
揭示对话情感识别中的弱点
本文通过分析大型语言模型(LLMs)在零样本设置中的表现,研究对话情感识别(ERC)的弱点,揭示了由于标注模糊性导致的系统性失败,并提出了一个LLM-as-Judge框架以实现更鲁棒的评估。
在Token空间中解读情感:SpeechLLMs的情感识别判别式适配
本文提出了针对SpeechLLMs的情感识别判别式适配方法,通过在线性分类头上使用最终提示词token的隐状态,提升性能和可解释性,消除幻觉并增强情感方向分析。
LLMs何时能取代微调NLU?生产会话系统中意图检测的决策框架
该论文评估了零样本LLM何时能在生产环境中取代微调NLU分类器进行意图检测,突出了LLM在超出范围检测、ASR鲁棒性和动态模式方面的优势,并为实践者提供了决策框架。
SeqLLM: Augmenting LLMs with Behavioral-Sequence Modeling for High-Stakes Decisions at WeChat Pay
SeqLLM is a framework that injects behavioral-sequence modeling into pretrained LLMs while preserving language ability, enabling joint analysis of text and behavior for high-stakes decisions. Deployed at WeChat Pay, it improves merchant screening precision from 92.0% to 97.5% and achieves state-of-the-art results on open recommendation benchmarks.
LLM Gateway Chat
LLM Gateway Chat 是一个平台,提供对多种AI模型的访问,用于聊天、图像、视频和音频生成。