大语言模型还是朴素贝叶斯?经典方法还是新途径?
摘要
本文对朴素贝叶斯与大语言模型在文本分类任务上进行了基准测试,发现在有标注数据的情况下,朴素贝叶斯仍然与大语言模型具有竞争力,并在资源受限环境中提供更高的吞吐量和更低的能耗。
arXiv:2609.13185v1 公告类型:新
摘要:大语言模型(LLMs)在研究计算中引发了一个反复出现的问题:像朴素贝叶斯(NB)这样的经典方法是否应该被淘汰?我们对互补朴素贝叶斯与零样本和少样本大语言模型进行了基准测试,这些模型涵盖四个模型家族和37倍的规模范围(从27B到1T参数的混合专家模型),应用于文本分类任务。大语言模型仅在无数据场景中占优势(在Amazon Polarity情感分析中为98.0% vs 88.2%),即使这一胜利也容易受到污染:在低污染情感任务中,朴素贝叶斯击败了零样本大语言模型(81.7% vs 73.0%)。然而,一旦有标注数据可用(例如AG News),朴素贝叶斯达到89.1%的准确率,与零样本27B大语言模型(89.0%)在统计上无法区分,并且优于397B前沿模型(84.8%),在商用CPU上达到每秒数千样本的吞吐量。微调后的DistilBERT达到90.6%,但在批量大小为1时吞吐量远低于朴素贝叶斯(表2)。我们测量的GPU吞吐量分析显示,小规模大语言模型的批量推理比朴素贝叶斯CPU推理慢40-486倍(乘数强烈依赖于宿主CPU),揭示了受内存带宽限制的结构性差距,每样本能耗大约低两个数量级。对于使用有标注数据执行文本分类的资源受限高性能计算从业者,朴素贝叶斯仍然是最佳选择。我们表明决策线取决于任务(朴素贝叶斯在主题分类中大约在$N \sim 10^4$个标签时达到大语言模型同等水平,而无数据情感分析在所有测试的N中都倾向于大语言模型),并提供了一个Kubernetes Helm操作符,使用可配置的阈值和可验证的Prometheus指标来自动化模型选择。
查看缓存全文
缓存时间: 2026/09/15 08:32
# 大语言模型还是朴素贝叶斯?经典技术还是新方法 来源:https://arxiv.org/html/2609.13185 Mohammad Firas Sada0009\-0006\-6045\-2940 (https://orcid.org/0009-0006-6045-2940)[mfsada@ucsd\.edu](mailto:[email protected])加州大学圣地亚哥分校圣地亚哥超级计算机中心拉霍亚 加州 美国 John Graham0000\-0002\-2139\-5617 (https://orcid.org/0000-0002-2139-5617)[jjgraham@ucsd\.edu](mailto:[email protected])加州大学圣地亚哥分校圣地亚哥超级计算机中心拉霍亚 加州 美国 Mahidhar Tatineni0009\-0003\-0709\-090X (https://orcid.org/0009-0003-0709-090X)[mahidhar@sdsc\.edu](mailto:[email protected])加州大学圣地亚哥分校圣地亚哥超级计算机中心拉霍亚 加州 美国 Dmitry Mishin0000\-0003\-1125\-448X (https://orcid.org/0000-0003-1125-448X)[dimm@lbl\.gov](mailto:[email protected])劳伦斯伯克利国家实验室1 回旋加速器路伯克利 加州 94720 美国 Seungmin Kim0000\-0001\-8052\-723X (https://orcid.org/0000-0001-8052-723X)[ehf@yonsei\.ac\.kr](mailto:[email protected])延世大学医学院首尔 大韩民国 Frank Würthwein0000\-0001\-5912\-6124 (https://orcid.org/0000-0001-5912-6124)[fkw@physics\.ucsd\.edu](mailto:[email protected])加州大学圣地亚哥分校圣地亚哥超级计算机中心拉霍亚 加州 美国 \(2026\) ###### 摘要\. 大语言模型 \(LLMs\) 在研究计算领域引发了一个反复出现的问题:像朴素贝叶斯 \(NB\) 这样的经典方法是否应该被淘汰?我们在文本分类任务上,对补集朴素贝叶斯与跨越四个模型家族、规模从 27B 到 1T 参数混合专家模型(相差 37 倍)的零样本和少样本大语言模型进行了基准测试。大语言模型仅在无数据场景下占据优势(在亚马逊极性情感分析任务上达到 98.0% 对 88.2%),即便这一优势也容易受数据污染影响:在一项低污染情感任务上,朴素贝叶斯*击败*了零样本大语言模型(81.7% 对 73.0%)。然而,一旦有标注数据可用(例如,AG News),朴素贝叶斯能达到 89.1% 的准确率,与零样本 27B 大语言模型(89.0%)在统计上无法区分,并且比 397B 前沿模型(84.8%)*更好*,同时在商用 CPU 上能达到每秒数千样本的处理速度。微调后的 DistilBERT 可达 90.6% 准确率,但批大小为 1 时的吞吐量远低于朴素贝叶斯(表 2 [https://arxiv.org/html/2609.13185#S4.T2](https://arxiv.org/html/2609.13185#S4.T2))。我们测量的 GPU 吞吐量分析显示,小模型大语言模型的批量推理比朴素贝叶斯 CPU 推理慢 40–486 倍(倍数强烈依赖于宿主 CPU),揭示了受内存带宽限制的结构性差距,且每样本能耗低约两个数量级。对于在资源受限的 HPC 环境下使用标注数据进行文本分类的从业者而言,朴素贝叶斯仍然是最佳选择。我们表明决策线取决于任务(朴素贝叶斯在主题分类任务中,约在标注样本数 N∼10⁴ 时达到大语言模型同等水平,而零样本情感分析在所有测试的 N 下都偏向大语言模型),并提供了一个 Kubernetes Helm 操作器,可通过可配置的阈值和可验证的 Prometheus 指标自动化模型选择。 朴素贝叶斯,大语言模型,文本分类,吞吐量基准测试,研究计算,NRP,绿色 AI,Kubernetes Helm 操作器 ††会议:高级研究计算实践与经验;2026年7月26日至30日;明尼苏达州明尼阿波利斯,美国 ††期刊年份:2026 ††版权:cc ††CCS:计算方法 自然语言处理 ††CCS:计算方法 通过分类进行监督学习 ††CCS:通用与参考 性能 ## 1\.引言 以 GPT\-4 和像 Qwen3 这样的开源系列为代表的大语言模型(LLMs)的兴起重塑了自然语言处理领域(Brown 等人,2020 [https://arxiv.org/html/2609.13185#bib.bib8](https://arxiv.org/html/2609.13185#bib.bib8);Ouyang 等人,2022 [https://arxiv.org/html/2609.13185#bib.bib11](https://arxiv.org/html/2609.13185#bib.bib11)),并向那些经常大规模分类文本的从业者提出了一个具体问题:*我们应该淘汰像朴素贝叶斯这样的经典概率分类器吗?*这个问题涉及真实的资源影响:共享 HPC 集群上的研究人员在部署大模型时面临着高昂的能源和财务成本(Strubell 等人,2019 [https://arxiv.org/html/2609.13185#bib.bib15](https://arxiv.org/html/2609.13185#bib.bib15);Schwartz 等人,2020 [https://arxiv.org/html/2609.13185#bib.bib16](https://arxiv.org/html/2609.13185#bib.bib16)),而补集朴素贝叶斯(CNB)(Rennie 等人,2003 [https://arxiv.org/html/2609.13185#bib.bib2](https://arxiv.org/html/2609.13185#bib.bib2))配合 TF\-IDF 双词组(Wang 和 Manning,2012 [https://arxiv.org/html/2609.13185#bib.bib3](https://arxiv.org/html/2609.13185#bib.bib3))在商用 CPU 上不到一秒即可完成训练,并能以亚毫秒级的速度对每个样本进行分类(第 4\.5 节 [https://arxiv.org/html/2609.13185#S4.SS5](https://arxiv.org/html/2609.13185#S4.SS5))。 近期关于在 HPC 集群中服务大语言模型的工作(Sada 等人,2025a [https://arxiv.org/html/2609.13185#bib.bib31](https://arxiv.org/html/2609.13185#bib.bib31))表明,现代加速器提高了能效,但无法匹敌经典方法的每样本效率。我们对跨越 27B 到 1T 参数的零样本/少样本大语言模型与 CNB 进行了基准测试:大语言模型仅在没有标注数据时具有结构性优势,而当有标注数据时,朴素贝叶斯在实测的 40–486 倍吞吐量优势下(由内存带宽饱和驱动),能达到或超过零样本大语言模型的性能,这一优势贯穿不同批大小和两种加速器。对于许多已经拥有标注数据的科学文本分类流程而言,转向大语言模型会增加不必要的复杂性和成本。我们随后表征了朴素贝叶斯变得优越的任务相关决策线,并通过一个可配置的 Kubernetes Helm 操作器将其付诸实践,该操作器导出 Prometheus 指标以供验证。 ## 2\.相关工作 Rennie 等人(2003 [https://arxiv.org/html/2609.13185#bib.bib2](https://arxiv.org/html/2609.13185#bib.bib2))引入了补集朴素贝叶斯;TF\-IDF 线性模型仍然具有竞争力(Wang 和 Manning,2012 [https://arxiv.org/html/2609.13185#bib.bib3](https://arxiv.org/html/2609.13185#bib.bib3));当有标注数据存在时,微调小模型通常优于零样本大语言模型(Bucher 和 Martini,2024 [https://arxiv.org/html/2609.13185#bib.bib14](https://arxiv.org/html/2609.13185#bib.bib14);Mosbach 等人,2023 [https://arxiv.org/html/2609.13185#bib.bib34](https://arxiv.org/html/2609.13185#bib.bib34))。在低标签场景下,无提示的标签高效方法如 SetFit(Tunstall 等人,2022 [https://arxiv.org/html/2609.13185#bib.bib36](https://arxiv.org/html/2609.13185#bib.bib36))和参数高效的少样本微调(T\-Few)(Liu 等人,2022 [https://arxiv.org/html/2609.13185#bib.bib35](https://arxiv.org/html/2609.13185#bib.bib35))提供了上下文学习的替代方案,而最近的零样本基准测试则比较了交叉编码器、重排序器和大语言模型(Aarab,2026 [https://arxiv.org/html/2609.13185#bib.bib46](https://arxiv.org/html/2609.13185#bib.bib46))。我们转而通过训练规模曲线(图 1 [https://arxiv.org/html/2609.13185#S5.F1](https://arxiv.org/html/2609.13185#S5.F1))直接表征低标签场景,该曲线定位了朴素贝叶斯达到大语言模型同等水平的点。大规模推理的能源成本已有充分记录(Strubell 等人,2019 [https://arxiv.org/html/2609.13185#bib.bib15](https://arxiv.org/html/2609.13185#bib.bib15);Schwartz 等人,2020 [https://arxiv.org/html/2609.13185#bib.bib16](https://arxiv.org/html/2609.13185#bib.bib16);Sada 等人,2025a [https://arxiv.org/html/2609.13185#bib.bib31](https://arxiv.org/html/2609.13185#bib.bib31))。 #### 系统与平台\. 我们的基准测试在与国家研究平台(NRP)相同的联邦科学 Kubernetes 基础设施上执行(Weitzel 等人,2025 [https://arxiv.org/html/2609.13185#bib.bib25](https://arxiv.org/html/2609.13185#bib.bib25))。我们团队的相关工作比较了在共享 HPC 集群中使用 Qualcomm Cloud AI 和 NVIDIA GPU 提供大语言模型服务的情况(Sada 等人,2025a [https://arxiv.org/html/2609.13185#bib.bib31](https://arxiv.org/html/2609.13185#bib.bib31));研究了用于网络内机器学习的实时 P4 可编程 FPGA 网络(Sada 等人,2025b [https://arxiv.org/html/2609.13185#bib.bib26](https://arxiv.org/html/2609.13185#bib.bib26));并展示了涵盖实时 NRP 遥测和 P4/FPGA/DPU 测试床的 SCinet NRE 演示(Sada 和 Graham,2025a [https://arxiv.org/html/2609.13185#bib.bib27](https://arxiv.org/html/2609.13185#bib.bib27)、b [https://arxiv.org/html/2609.13185#bib.bib28](https://arxiv.org/html/2609.13185#bib.bib28))。 ## 3\.方法论 ### 3\.1\.模型 我们评估了从经典到大规模的一系列模型。经典基线:补集朴素贝叶斯(CNB)(Rennie 等人,2003 [https://arxiv.org/html/2609.13185#bib.bib2](https://arxiv.org/html/2609.13185#bib.bib2))配合 TF\-IDF 双词组(Wang 和 Manning,2012 [https://arxiv.org/html/2609.13185#bib.bib3](https://arxiv.org/html/2609.13185#bib.bib3))以及逻辑回归(LR),两者均仅使用 CPU。微调 Transformer 模型:DistilBERT(66M)(Sanh 等人,2019 [https://arxiv.org/html/2609.13185#bib.bib33](https://arxiv.org/html/2609.13185#bib.bib33)),使用 AdamW(学习率 3×10⁻⁵,批大小 32)进行微调。生成式大语言模型:Qwen3.6\-27B(服务检查点 Qwen/Qwen3.6\-27B)在零样本和少样本(k=5)设置下,以及 Qwen3.5(397B)前沿模型(Qwen/Qwen3.5\-397B\-A17B\-FP8,一个拥有 17B 活跃参数的 397B 混合专家模型)在零样本设置下,通过托管的 NRP 端点提供服务(Weitzel 等人,2025 [https://arxiv.org/html/2609.13185#bib.bib25](https://arxiv.org/html/2609.13185#bib.bib25))。判别式大语言模型:一个使用 LoRA 微调的 Qwen3\-8B 序列分类器(Hu 等人,2022 [https://arxiv.org/html/2609.13185#bib.bib32](https://arxiv.org/html/2609.13185#bib.bib32)),可在单次前向传播中进行预测,将其包含在内是为了在大模型上进行平等(判别式)基础比较,而不是通过自回归生成。吞吐量探针:GPU 上的 OLMo\-2\-1B(allenai/OLMo\-2\-0425\-1B\-Instruct,1\.48B)(Groeneveld 等人,2024 [https://arxiv.org/html/2609.13185#bib.bib40](https://arxiv.org/html/2609.13185#bib.bib40))。所有生成式推理均使用温度 0。 ### 3\.2\.数据集 我们使用三个具有分层划分(随机种子 42)的基准数据集。亚马逊极性(Zhang 等人,2015 [https://arxiv.org/html/2609.13185#bib.bib18](https://arxiv.org/html/2609.13185#bib.bib18)):二元情感分类,训练集 10K,测试集 2K;大语言模型存在高度的预训练重叠。AG News(Zhang 等人,2015 [https://arxiv.org/html/2609.13185#bib.bib18](https://arxiv.org/html/2609.13185#bib.bib18)):四类主题分类,训练集 10K,测试集 2K;干净且标准。20 Newsgroups:20 类主题分类,训练集 11,314,测试集 7,532;已移除头部/页脚(“困难”设置)。交叉发布引入了有利于分布式方法的标签噪声。我们将亚马逊极性和 AG News 的训练集上限设为 10K,以保持跨数据集的标注数据预算恒定(20 Newsgroups 本身已约 11K),并且因为大语言模型的每样本评估成本使得更大规模的比较不切实际;训练规模曲线(图 1 [https://arxiv.org/html/2609.13185#S5.F1](https://arxiv.org/html/2609.13185#S5.F1))显示朴素贝叶斯和 DistilBERT 的准确率在远低于 10K 时就已饱和,因此更大的子样本不会改变决策线结论。 ### 3\.3\.评估与基础设施 我们报告准确率、加权 F1 分数、 McNemar 检验和基于每样本预测的配对自助法置信区间。吞吐量测试使用预分词的样本,批大小从 1 到 128,硬件为 NVIDIA RTX 3090(24 GB)和 Tesla V100\-SXM2\-32GB,GPU 板卡功率通过 NVML 读取。CPU 基线运行在双路 Intel Xeon Gold 6248R(48 核)上,并设置 NUMA 亲和性。实验作为 Kubernetes 批处理作业在 NRP Nautilus 集群上运行(Weitzel 等人,2025 [https://arxiv.org/html/2609.13185#bib.bib25](https://arxiv.org/html/2609.13185#bib.bib25))。本研究的≈15 GPU 小时的自托管计算,基于测量的板卡功率和美国电网强度(367 gCO2e/kWh)(美国能源信息署,2024 [https://arxiv.org/html/2609.13185#bib.bib51](https://arxiv.org/html/2609.13185#bib.bib51)),在 SCI 框架下(绿色软件基金会,2025 [https://arxiv.org/html/2609.13185#bib.bib52](https://arxiv.org/html/2609.13185#bib.bib52))产生的运营碳足迹约为 10⁰ kgCO2e,相较于单台 V100 GPU 服务器约 2,159 kgCO2e 的隐含碳(Ji 等人,2024 [https://arxiv.org/html/2609.13185#bib.bib47](https://arxiv.org/html/2609.13185#bib.bib47))可以忽略不计。 ### 3\.4\.大语言模型端点详情 Qwen3.6\-27B 和 Qwen3.5(397B)模型通过 vLLM(vLLM Team,2025 [https://arxiv.org/html/2609.13185#bib.bib48](https://arxiv.org/html/2609.13185#bib.bib48))(连续批处理)在托管的 NRP 端点上提供服务,我们将其用于所有准确率测量。受控的吞吐量和功率测量(表 5 [https://arxiv.org/html/2609.13185#S4.T5](https://arxiv.org/html/2609.13185#S4.T5))则使用我们自己托管在专用 GPU 上的模型,即作为小型生成式探针的 OLMo\-2\-1B 和 DistilBERT,这样 GPU 板卡功率(NVML)可归因于单一的同位工作负载。解码使用温度 0 和最大序列长度 8,192。 ### 3\.5\.内存带宽分析 批大小为 1 的推理下限为 \(t_{\text{min}} = 2P / B_{\text{mem}}\),其中 \(P\) 是参数量,\(B_{\text{mem}}\) 是内存带宽。对于 OLMo\-2\-1B(1\.48B 参数,FP16 格式约 2\.96 GB;RTX 3090 带宽 936 GB/s),\(t_{\text{min}} \approx 3.2\) 毫秒/样本(≈316 样本/秒)。我们测得的峰值为 200 样本/秒,达到了该极限的≈63%,其余损失用于注意力/KV 和内核启动开销;批大小超过 8 后吞吐量不再提升,因为解码步骤仍受权重流限制而非计算限制。NB 的 TF\-IDF 模型可放入 CPU 缓存,并接近稀疏 BLAS 吞吐量峰值。 ### 3\.6\.可重复性 我们固定了划分(随机种子 42)、分词器设置和 vLLM 启动标志;作业使用与 NRP 其他租户一致的命名空间作用域配额(Weitzel 等人,2025 [https://arxiv.org/html/2609.13185#bib.bib25](https://arxiv.org/html/2609.13185#bib.bib25))。一个公共产物包(脚本、清单和配置,可复现表 1 [https://arxiv.org/html/2609.13185#S4.T1](https://arxiv.org/html/2609.13185#S4.T1) 至 5 [https://arxiv.org/html/2609.13185#S4.T5](https://arxiv.org/html/2609.13185#S4.T5),包含显式的 NUMA/CUDA 绑定)可在 https://github.com/groundsada/llms-or-naive-bayes 获取。 ## 4\.结果 ### 4\.1\.亚马逊极性:二元情感分析 在亚马逊极性数据集(表 1 [https://arxiv.org/html/2609.13185#S4.T1](https://arxiv.org/html/2609.13185#S4.T1))上,考虑到大语言模型存在大量的预训练重叠,情感分析对大语言模型而言很简单:零样本 Qwen3.6\-27B 达到 97.8%,少样本达到 98.0%,而 CNB 为 88.2%,差距具有统计学显著性(McNemar \(p<0.05\);准确率差异的配对自助法置信区间不包含 0)。Qwen3.5(397B)*前沿*模型并未比 27B 模型有所提升(98.0%),表明此处的瓶颈是任务本身而非模型规模。判别式微调的 Qwen3\-8B 达到 97.2%,接近生成式大语言模型,但仅需单次前向传播(91 毫秒 对比 ∼13 秒)。LR 与 CNB 在统计上无显著差异。关键的是,CNB 的分类速度为 0.06 毫秒/样本,大约比生成式大语言模型快五个数量级。我们将这一零样本胜利标记为*容易受数据污染影响*(亚马逊极性是一个长期公开的基准测试,具有较高的预训练重叠),并在第 5 节 [https://arxiv.org/html/2609.13185#S5.SS0.SSS0.Px5](https://arxiv.org/html/2609.13185#S5.SS0.SSS0.Px5) 通过一个低污染情感任务对其进行测试,结果大语言模型的优势发生了逆转。 表 1\.亚马逊极性(2K 测试集;大语言模型行在 500 样本上测试)。延迟在批大小为 1 时测量;生成式大语言模型延迟包括推理 token。 ### 4\.2\.AG News:干净的多分类 在 AG News 数据集(表 2 [https://arxiv.org/html/2609.13185#S4.T2](https://arxiv.org/html/2609.13185#S4.T2))上,一旦有标注数据可用,CNB(89.1%)与零样本 27B 大语言模型(89.0%)在统计上*无显著差异*(McNemar \(p=0.07\)),与少样本(88.4%)也无显著差异,而其处理速度为 0.03 毫秒/样本,对比∼13 秒。引人注目的是,397B 前沿模型表现*更差*(84.8%):经过推理训练的模型在简单的四类主题任务上过度生成内容,因此规模在此并无帮助。微调模型在准确率上领先(DistilBERT 90.6%,判别式 Qwen3\-8B 93.3%),但后者仍需 42 毫秒/样本(单次前向传播),比 CNB 慢 1,000 多倍。 表 2\.AG News(2K 测试集;大语言模型行在 500 样本上测试)。延迟在批大小为 1 时测量。 ### 4\.3\.20 Newsgroups:带噪声的多分类 在 20 Newsgroups 数据集(表 3 [https://arxiv.org/html/2609.13185#S4.T3](https://arxiv.org/html/2609.13185#S4.T3))——移除了头部/页脚的真实 20 类主题任务上,CNB(71.2%)与零样本 27B 大语言模型(71.8%)在统计上*无显著差异*(McNemar 检验不显著),而少样本略优(73.8%)。397B 前沿模型再次表现*更差*(66.4%),显著低于 CNB 和 27B 模型(McNemar \(p<0.05\)):经过推理训练的模型在细粒度多类主题标签上校准不佳。DistilBERT 在此落后于 NB(67.2%);由于存在交叉发布带来的标签噪声且每类仅约 565 个样本,微调编码器在*任何*训练规模下都未能超越稀疏词袋模型(图 1 [https://arxiv.org/html/2609.13185#S5.F1](https://arxiv.org/html/2609.13185#S5.F1))。只有判别式微调的 Qwen3\-8B 在准确率上领先(76.3%),但速度为 97 毫秒/样本,大约比 CNB(0.14 毫秒/样本)慢 700 倍(比生成式大语言模型快五个数量级)。 表 3\.20 Newsgroups(真实 20 类;7,532
相似文章
探索小型语言模型作为分类器与Jev竞争(分享我的发现)
作者通过分析高温度下的对数概率和校准,探索使用如Gemma 4等小型语言模型作为分类器,并在GitHub上分享代码与发现。
不要让LLM说话,直接探测它(8分钟阅读)
本文介绍了一种技术,该技术从LLM的最后一个提示标记处提取隐藏状态,无需文本生成即可进行分类,使用一个小型MLP读取模型的内部决策,从而实现快速且廉价的零样本分类器。
更经济的LLM标签方法
本文描述了一种经济有效的方法,使用像gpt5.6 Luna这样的廉价LLM为提交打标签,并结合更快的朴素贝叶斯分类器,以减少基于Perl工作流程中的延迟和开支。
@stanfordnlp:在大语言模型时代,仍有使用细致语言学的机会!
斯坦福NLP宣布,一篇题为《大语言模型中的未完成体悖论》的语言学视角NLP论文在ACL 2026上获得最佳论文奖,鼓励对大语言模型进行更细致的语言学评估。
BayesBench: 多轮证据累积下LLM信念轨迹的评估
BayesBench评估了在多轮证据累积任务中,大语言模型的信念更新与贝叶斯推理的接近程度,发现虽然扩展规模能改善潜在推理,但模型难以将这种理解用于下游预测。