AnySimLite: 一种轻量级少样本相似度编码器用于设备端语音相关分类
摘要
介绍 AnySimLite,一种用于设备端语音相关分类任务的轻量级相似度编码器,在模型大小不到 qLLaMA-LoRA-7B 基线的 1/250 的情况下,实现了最先进或具有竞争力的性能。
arXiv:2606.26452v1 公告类型: 新
摘要: 为了最大程度地减少隐私问题并降低智能手机等边缘设备上的推理延迟,轻量级设备端模型对终端用户应用仍然至关重要。其中许多应用涉及自然语言分类,但部署多个专用模型会带来内存占用挑战。我们研究问题:能否通过将多个语音相关(SA)分类任务简化为精细的文本相似性公式,用单个轻量级架构来解决?我们提出 AnySimLite,一种结合词级和字符级通道的轻量级相似度编码器。结合数据集转换策略,我们在多个 SA 分类任务上评估了 AnySimLite,并表明它在少样本设置下持续实现最先进(SOTA)或与 SOTA 相当的性能,同时保持低内存占用。即使在最坏情况下,性能下降也低于 7%,而模型大小仅为 SOTA qLLaMA_LoRA-7B 基线的不到 1/250。
查看缓存全文
缓存时间: 2026/06/26 05:16
# AnySimLite:一种轻量级少样本相似性编码器,用于设备端语音相关分类
来源:https://arxiv.org/html/2606.26452
Ghosh Bhatia Goyal Bagri Shariff Shanmugam
###### 摘要
为了最大程度减少边缘设备(如智能手机)上的隐私顾虑和推理延迟,轻量级设备端模型对最终用户应用仍然至关重要。其中许多应用涉及自然语言分类,但部署多个专门的模型会带来内存占用方面的挑战。我们研究的问题是:能否通过将多个语音相关(SA)分类任务简化为一种细微文本相似性(NTS)形式,用一个单一的轻量级架构来解决?我们提出了**AnySimLite**,一种轻量级的相似性编码器,它结合了词级和字符级通道。结合一种数据集变换策略,我们在多个SA分类任务上评估了AnySimLite,并表明它在少样本设置中始终达到最先进(SOTA)或与SOTA相当的性能,同时保持较低的内存占用。即使在最差情况下,性能下降也保持在7%以下,而模型大小仅为SOTA基线qLLaMA_LoRA-7B的<1/250。
###### 关键词:
分类,自然语言处理,文本嵌入,文档相似性
22脚注:,3 这些作者分别在之前任职和实习期间对本研究做出了贡献。
## 1 引言
设备端模型在边缘设备的推理管道中至关重要,其在网络延迟、数据隐私以及数据中心整体低碳足迹方面具有明显优势。这些模型应具备低延迟和低资源需求(存储、内存、功耗)。现代智能手机作为SDK运行时和OEM/第三方应用的一部分,包含了多个模型。由于这类模型数量庞大,它们在存储资源需求上累积起来。因此,持续优化所有设备端解决方案的资源消耗是必要的。如今,许多设备端模型是为非常特定的用例设计的,因此其架构和训练方法仅适用于狭窄场景。然而,在许多不同的解决方案和SDK中,存在许多解决相同核心任务或可简化为同一问题的冗余模型。许多语音相关任务需要处理自动语音识别(ASR)的转录文本。一个显著的例子是语音助手中的意图检测,其中转录文本需要分类为多个已知意图的集合。在语音相关的自然语言处理(NLP)中,这涉及文本相似性。
参见图注
图1:通过将NLP分类简化为NTS来解决。
文本相似性是识别两个文本单元是否相似的任务。输入涵盖从推文等短文本到长篇文档。文本相似性也可能包括量化一个短查询与一个较长文档之间的相似度。文献中有多种文本相似性方法,从词汇匹配和TF-IDF到语义嵌入。实践中,根据具体问题和可用数据集,会选择其中一种方法——算法方法、神经方法或两者的混合。在许多情况下,文本相似性也可能是高度专门化的,即两个文本仅仅因为某些共同特征的对齐而被认为是相似的,而非传统的词汇或语义相似性。我们将此称为“细微文本相似性”(NTS)。
为此,我们致力于设计一种轻量级架构,用于设备端部署,以单独解决多个可简化为NTS任务的任务(图1)。其核心是,我们提出了一组轻量级架构,并通过一个称为“事件标题相似性”的玩具问题对其进行调优。这些架构的设计考虑到了设备端部署和相关应用的近实时延迟目标。我们首先展示了这种架构在解决玩具问题上的有效性,并进行了详细的消融研究,以识别影响最大的组件。然后,我们确定了每种提议架构的最佳变体,并使用相关指标评估了它们在解决流行公共数据集上的不同问题陈述时的效用。
我们的贡献可总结如下:
- • 我们提出了一种轻量级架构,用于解决一个名为“事件标题相似性”的示例性细微文本相似性(NTS)问题,优化了设备端部署和低推理延迟。
- • 我们展示了如何将多个NLP任务归结为NTS,并使用我们的轻量级架构在少样本设置中以与SOTA相当的性能解决它们。我们提出的模型AnySimLite在显著降低内存占用的同时,始终达到或超越最先进(SOTA)分数。
- • 我们引入了一种新颖的数据集变换技术,用于从分类数据集中导出带标签的文档对,重点关注“困难”对的采样。
据我们所知,我们是第一个探索通过问题归约用统一轻量级模型解决多种语音相关NLP分类任务的工作。
## 2 预备知识
### 2.1 问题形式化
在文本相似性问题中,目标是将两个文本文档之间的相似性建模为一个可量化的分数。数学上,目标是构建一个模型 \(f\),使得两个文本文档 \(d_1\) 和 \(d_2\) 被认为比 \(d_3\) 和 \(d_4\) 更相似,当且仅当 \(f(d_1, d_2) > f(d_3, d_4)\)。这意味着交换律成立,即 \(f(d_i, d_j) = f(d_j, d_i)\)。
在本工作中,我们展示了一种方法,将选定的NLP问题归约到细微文本相似性(NTS)任务。因此,对于一个任务 \(\mathcal{G} \in \mathbf{R} \subset \mathbf{L}\),其中 \(\mathbf{L}\) 是所有NLP任务的集合,\(\mathbf{R}\) 是可归约到NTS的任务子集,我们将 \(\mathcal{G}\) 转换为 \(\mathcal{G}'\),使得 \(\mathcal{G}' \equiv f\)。然后,通过解决 \(\mathcal{G}'\),我们找到 \(\mathcal{G}\) 的解。
### 2.2 玩具问题描述
在本节中,我们描述玩具问题陈述及其选择原因。文本相似性在文献中主要被探索用于确定两个文本文档是否语义相似。虽然解决这一问题的方法可能包括词汇匹配,但现代方法涉及将文档编码为捕获文档语义属性的嵌入。然而,更一般的场景是文档的相似性不局限于这两种极端,即相似性并不仅仅意味着语义相似性。例如,可能想知道一个电子商务网站上的两个产品评论在情感上是否相似,即使评论者正负面情感背后的体验存在显著差异。类似地,两个电子邮件可能根据它们是否都是垃圾邮件而被认为是相似的,而不管其实际内容如何。这打开了解决多种问题的可能性,例如情感分类和邮件垃圾检测,只需通过计算查询文档与每个相应类别的预标注示例的相似性,在少样本设置中即可实现。
为了为这种细微文本相似性奠定基础,我们需要考虑一个问题,其中一对文本文档有一个独特的约束,用于判断相似或不相似。为了最小化架构中的偏见,这种约束必须不显而易见。此外,由于我们的动机用例是设备端部署,我们力求选择一组在终端设备上容易获得的数据点。因此,我们选用了一个称为“事件标题相似性”的NTS玩具问题,其中两个事件标题被认为是相似的,当且仅当对应的两个文本单元描述相同的基础事件并涉及相同的人物集。例如,“John的生日派对”被认为既不与“与John的会议”相似,也不与“Sarah的生日派对”相似,因为在每种情况下,至少基础事件类别或涉及的名人实体(NE)之一不同。因此,在这种情况下,
\[
f(d_1, d_2) \equiv \eta(d_1, d_2) \wedge \nu(d_1, d_2)
\]
(1)
其中 \(\eta\) 和 \(\nu\) 分别表示分类标题 \(d_1\) 和 \(d_2\) 是否涉及相同事件和相同NE的函数。为了复杂性分析,我们考虑当数据库(DB)或知识图谱(KG)要填充事件标题且避免相似标题重复的问题。场景为:(a) 初始化(Init):将事件标题加载到空DB/KG中;(b) 更新(Add):向已填充的DB/KG中添加一个额外的事件标题。
参见图注
图2:**AnySimLite**架构,包含一个带有词和字符通道的轻量级编码器。
表1:消融研究:我们选择B3作为AnySimLite架构的最佳基础候选,使用带有注意力层的词通道和带有全局最大池化的字符通道以及简单拼接;B8为其蒸馏部署变体。
## 3 NTS架构
我们描述为解决玩具问题而探索的配置,并以此作为轻量级设备端NTS的基础。
### 3.1 作为二分类
通过将两个标题拼接在一起,生成一个字符串,可以对其进行分词并输入模型架构。在这里,用于监督学习的训练数据集需要组织成带二值相似性标签的标题对。
#### 3.1.1 词嵌入
仅使用词嵌入可以实现非常低的内存占用,但由于词汇表限制,这种模型无法识别词典外(OOV)NE的差异,而这正是一个关键要求。虽然我们的玩具问题对词标记顺序依赖较少,但为了推广到下游NLP任务,我们将词嵌入输入到BiLSTM层。Init、Add的延迟分别为 \(\mathcal{O}(n^2)\) 和 \(\mathcal{O}(n)\)。
#### 3.1.2 词和字符嵌入
为了解决上述OOV NE的问题,我们引入了一个额外的字符嵌入通道。Init、Add的延迟分别为 \(\mathcal{O}(n^2)\) 和 \(\mathcal{O}(n)\)。
### 3.2 作为标题编码器
像二分类那样拼接标题的一个关键问题是违反了文本相似性的交换律(参见第2.1节)。为了解决这个问题,我们转向编码器网络方法,为标题创建唯一的嵌入。两个标题的相似性随后可以由两个对应嵌入的余弦相似度输出。
#### 3.2.1 句子变换器
在预训练和微调两种设置下使用句子变换器可以减少训练数据需求。它进一步导致Init和Add的延迟分别为 \(\mathcal{O}(n)\) 和 \(\mathcal{O}(1)\)。
#### 3.2.2 词和字符嵌入——**AnySimLite**
为了减小编码器的内存占用,我们用包含词和字符嵌入通道的简单网络替换了句子变换器架构。这种方法保留了编码器架构的优点,包括低延迟(Init和Add分别为 \(\mathcal{O}(n)\) 和 \(\mathcal{O}(1)\))以及由于字符嵌入与词嵌入并存而能够识别OOV NE差异的优点。
基于实证结果和消融研究,我们选择此作为事件标题相似性架构,并将该模型称为AnySimLite。图2详细说明了该模型的架构。
#### 3.2.3 值得注意的替代方案
##### 作为孪生网络
我们尝试使用基于三元组训练的孪生网络,而不是标题对。然而,对“锚点-负样本”(不相似但不是太不相似)进行困难示例采样的挑战需要手工操作和对问题领域的了解。由于我们的最终目标是将该架构作为多个任务的基础,因此由于前述挑战,这种方法不可行。
##### 作为来源聚类
通过组织训练数据形成相似标题的聚类,我们尝试了一种多类分类方法,其中每个类别实际上表示一个事件和一组NE的组合。虽然这种方法在遵循相同数据分布和NE人口统计(许多常见事件和NE)的验证集上效果很好,但当测试集中的事件标题不遵循相同分布时,效果很差。因此,我们放弃了这种方法。
| 任务 \(\in \mathbf{R}\) | 数据集 | 指标 | 方法 | 分数(相对于最优的 \(\Delta\)) | 参数量(M) |
|----------------------|--------|------|------|-------------------------------|------------|
| 文本相似性 | TitleSimCurated | 准确率 | BERT | 75.39 | 108 |
| | | | MiniLM L12-v2 | 84.16 | ∼25 |
| 类别数 = 2 | | | MiniLM L6-v2 | 86.14 | ∼20 |
| | | | \cellcolorgray\!25 AnySimLite | \cellcolorgray\!25 88.73(↑3.01%) | \cellcolorgray\!25 0.1* |
| \(F_1\)/准确率 | Sharma et al., 2019 | | 66.30 / 74.60 | - |
| | S-CNN (han2022building) | | 82.02 / 83.32 | - |
| | Quora Question Pairs | qLLaMA_LoRA-7B (han2025enhancing) | 84.90/88.67 | 7000 |
| 类别数 = 2 | LLaMA-33B_5shot (han2025enhancing) | 49.39 / 63.36 | 33000 |
| | \cellcolorgray\!25 AnySimLite | \cellcolorgray\!25 82.96 / 82.77(↓2.29%/↓6.65%) | \cellcolorgray\!25 2.6 |
| 情感分类 | Sentiment-140 (go2009twitter) | \(F_1\)/准确率 | RoBERTa-BiLSTM (rahman2025roberta) | 82.25/82.25 | >125 |
| | BERT (elmitwalli2024sentiment) | 81.14/82.54 | 110 |
| 类别数 = 2 | GPT-3 (elmitwalli2024sentiment) | 79.13/79.11 | 175000 |
| | \cellcolorgray\!25 AnySimLite | \cellcolorgray\!25 80.17/80.22(↓2.53%/↓2.81%) | \cellcolorgray\!25 1.3 |
| | IMDB Movie Reviews (maas-EtAl:2011:ACL-HLT2011) | \(F_1\)/准确率 | RoBERTa-BiLSTM (rahman2025roberta) | 92.35/92.36 | >125 |
| | BERT (elmitwalli2024sentiment) | 93.80/93.80 | 110 |
| 类别数 = 2 | GPT-3 (elmitwalli2024sentiment) | 91.19/90.76 | 175000 |
| | \cellcolorgray\!25 AnySimLite | \cellcolorgray\!25 88.68/88.68(↓5.46%/↓5.46%) | \cellcolorgray\!25 1.1 |
| 意图检测 | SNIPS (coucke2018snipsvoiceplatformembedded) | 准确率 | ESIE-BERT (guo2023esiebertenrichingsubwordsinformation) | 99.10 | >110 |
| | LIDSNet (9680131) | 98.00 | 0.59 |
| 类别数 = 7 | \cellcolorgray\!25 AnySimLite | \cellcolorgray\!25 98.21(↓0.90%) | \cellcolorgray\!25 0.35 |
| | ATIS (price-1990-evaluation) | 准确率 | ESIE-BERT (guo2023esiebertenrichingsubwordsinformation) | 98.10 | >110 |
| | LIDSNet (9680131) | 95.97 | 0.065 |
| 类别数 = 8(粗粒度),21 [9680131] | \cellcolorgray\!25 AnySimLite | \cellcolorgray\!25 97.62(↓0.49%) | \cellcolorgray\!25 0.12 |
| 垃圾检测 | SMS Spam Collection (sms_spam_collection_228) | \(F_1\)/准确率 | Shen et al., 2025 (SHEN202579) | 97.08/99.28 | >110 |
| | Liu et al., 2021 (9433507) | 96.13/98.92 | - |
| 类别数 = 2 | \cellcolorgray\!25 AnySimLite | \cellcolorgray\!25 97.50/99.28(↑0.43%/==) | \cellcolorgray\!25 0.47 |
| 主题分类 | AG News (NIPS2015_250cf8) | 准确率 | BERT-base + PGKD (dipalo2024performanceguidedllmknowledgedistillation) | 89.50 | - |相似文章
Lite Any Stereo V2:更快更强的高效零样本立体匹配
Lite Any Stereo V2 提出了一种高效的立体匹配方法,通过优化的架构和训练策略(包括仅2D成本聚合框架和三阶段训练策略),在显著降低延迟的同时实现了最先进的精度。
语音识别中的Convex低资源口音鲁棒语言检测
本文介绍了CLD,一种基于凸优化的轻量级语言检测头(用于ASR),在不到100个训练样本下实现97-98%的准确率,同时将计算成本降低13倍,解决了5种语言和24种子方言的口音和方言鲁棒性问题。
用于鲁棒代码切换语音识别的基于LLM生成的近失对比训练
提出了一种POI感知的对比训练框架,利用LLM生成的近失假设来增强ASR在代码切换区域的鲁棒性,在两个基准测试上实现了一致的错误率降低。
对齐就是一切:面向通用音频-语言模型的无指令训练
本文介绍了一种无指令的纯对齐方法,用于构建大型音频-语言模型,该方法通过冻结LLM和音频编码器,仅在自生成数据上训练一个轻量级投影器,实现了与传统多阶段流程相比更少数据下的竞争性性能。
基于SpeechLLM的流式语音转文本翻译
提出了一种用于流式语音转文本翻译的SpeechLLM架构,该架构根据音频自适应决定何时输出令牌,实现了1-2秒的延迟,且质量接近非流式基线。