从TF-IDF到Transformer:情感分类的比较与集成方法

arXiv cs.CL 论文

摘要

本文比较了多种机器学习与Transformer模型在电影评论情感分类中的表现,发现RoBERTa达到了93.02%的准确率,而软投票集成方法进一步提升了性能。

arXiv:2605.22003v1 公告类型:新 摘要:情感分析,也称为意见挖掘,主要尝试从任何基于文本的数据中提取观点。在电影评论和批评的背景下,情感分析可以成为预测电影评论总体正面或负面情绪的有用工具。由于机器学习模型主要依赖于统计词表示,它们可能难以准确理解上下文或形而上情感。本文的目标是研究并将电影评论分类为正面和负面情感。为此,考虑了多种机器学习模型,并采用了自然语言处理(NLP)方法进行数据预处理和模型评估。使用了IMDb数据集。具体来说,评估了朴素贝叶斯、逻辑回归、支持向量机(SVM)、LightGBM、LSTM以及基于Transformer的模型如RoBERTa和DistilBERT。经过大量的准确率、精确率、召回率、F1分数和ROC-AUC测试,RoBERTa以93.02%的准确率表现优于所有其他模型。结合所有模型的软投票集成方法也提高了分类性能,表明模型集成在情感分析中效果良好。
查看原文
查看缓存全文

缓存时间: 2026/05/22 08:45

# 从 TF-IDF 到 Transformers:情感分类的比较与集成方法
来源:https://arxiv.org/html/2605.22003

###### 摘要

情感分析,也称为观点挖掘,主要试图从基于文本的数据中提取观点。在电影评论和影评的背景下,情感分析可以成为预测电影评论总体上是正面还是负面的有用工具。由于机器学习模型在很大程度上依赖于统计词表示,它们可能难以准确理解上下文或形而上的情感。本文的目标是将电影评论分为正面和负面情感。本文考虑了多种机器学习模型,并采用自然语言处理(NLP)方法进行数据预处理和模型评估。使用了 IMDb 数据集。具体评估了朴素贝叶斯、逻辑回归、支持向量机(SVM)、LightGBM、LSTM 以及基于 Transformer 的模型如 RoBERTa 和 DistilBERT。经过大量关于准确率、精确率、召回率、F1 分数和 ROC-AUC 的测试,RoBERTa 的表现优于所有其他模型,准确率达到 93.02%。结合所有模型的软投票集成也提高了分类性能,表明模型集成对情感分析效果良好。

## I. 引言

电影评论可简单地定义为对电影进行的批判性分析,包括情节、主题、导演、类型、剧本、表演等各种组成部分。电影评论的主要目标是对电影质量提供见解。在基于文本的电影评论中,行间隐藏着许多细微差别。机器学习模型和 Transformer 模型,如 SVM、决策树和神经网络,可用于解码纯粹的观点。本文着重于使用机器学习模型对这些电影评论进行分类。一些模型,如逻辑回归、朴素贝叶斯、线性 SVM 和 LightGBM,在句子级别进行训练。然后,它们被聚合以理解评论级别的情绪。比较分析确定了最有效的模型和聚合策略,用于稳健的情感分类。最后,为了利用不同模型的优势,探索了一种软投票集成方法,该方法结合了之前所有模型的三个预测概率,以提高整体情感分类精度。

论文的结构如下:第二部分介绍相关工作,第三部分概述数据集及预处理方法。第四部分讨论了特征提取和学习模型。最后,第五部分讨论了结果,第六部分总结全文。

参见图 1:软投票集成架构。

## II. 文献综述与相关工作

情感分析有着悠久的历史,从统计词频和使用词典查询,到现在使用深度学习模型或基于 Transformer 的模型。AlShammari 证明,TF-IDF 在 Python 中仍然适用于快速关键词提取[1 (https://arxiv.org/html/2605.22003#bib.bib1)]。Kibriya 等人提出,当我们有大量文本时,多项朴素贝叶斯是一种坚实、简单、快速且可靠的情感分析方法[7 (https://arxiv.org/html/2605.22003#bib.bib2)]。随后出现了结合词汇信息和机器学习模型的混合方法,这改进了情感分类。Kumar 等人使用了 IMDb 数据集。他构建了一个框架,结合了机器学习技术和基于词汇的特征进行情感分析。Kumar 的工作表明,同时使用这两种方法比单纯依赖词汇或统计方法更好[9 (https://arxiv.org/html/2605.22003#bib.bib3)]。深度学习技术通过识别文本中的模式增强了情感分析。Yu 研究了 CNN(卷积神经网络)与 TF-IDF 及词袋表示在电影评论分类中的应用。这表明,当有强大的处理方法支持时,卷积模型可用于检测局部语义模式。与此同时,研究人员也在研究基于聚类的方法,用于分析 IMDB 评论中的情感。这可以作为无监督技术仍然对文本分析有用的证据。[15 (https://arxiv.org/html/2605.22003#bib.bib5)]

## III. 数据集与预处理

### III-A. 数据集

对于数据集,使用了广泛认可的 IMDb 数据集[12 (https://arxiv.org/html/2605.22003#bib.bib6)],包含 50,000 条电影评论。评论被平均分成训练集和测试集。每个集合都是平衡的,25,000 条标记为正面,25,000 条标记为负面。数据集没有缺失或错位的条目。数据集的庞大容量使得测试平台对机器学习可靠,同时确保正面和负面情感类别有良好的混合。这使得分类模型能够以强有力的方式进行测试。

表 I:IMDB 电影评论数据集汇总统计

### III-B. 数据预处理

数据预处理将原始文本转换为结构化格式,确保数据集没有不一致和无关信息,这些信息可能会对模型的整体性能产生负面影响。本研究数据预处理的第一步是文本规范化。随后是分词,将句子分解为单个单词。然后是词干提取或词形还原过程。这个过程将单词简化为最基本的形式。为了确保测试的公正性和公平性,数据集被分为两部分:训练集和测试集。TF-IDF 向量化器还通过根据单词的频率和相关性捕捉其重要性,将文本转换为数字。这些预处理步骤共同提高了模型检测相关文本模式的能力,从而改善了整体情感分类。

## IV. 提出的方法

参见图 2:模型性能指标评估:准确率、F1 分数和 ROC-AUC。

### IV-A. 特征工程

采用了两种主要策略将单词转化为数字。对于传统模型,使用了 TF-IDF,将词汇表限制为 10,000 个信息量最大的词,确保不泄漏测试集的任何信息。[3 (https://arxiv.org/html/2605.22003#bib.bib7)]。向量化器在训练语料库上拟合,并一致地应用于训练和测试数据,确保逆文档频率仅从训练数据计算,以防止泄漏。

与此同时,对于 Transformer 模型,考虑了子词分词,并使用了其上下文嵌入[2 (https://arxiv.org/html/2605.22003#bib.bib8)]。与静态的 TF-IDF 特征相比,RoBERTa 和 DistilBERT 等模型提供了更丰富的语义表示和更动态的表示。

### IV-B. 模型训练与架构

**SVM(线性核)**:使用支持向量机(SVM)在 TF-IDF 特征上进行训练。由于 SVM 处理高维度和稀疏特征空间,考虑了线性核。性能:准确率 = 0.8961,F1 = 0.8983。

**DistilBERT**:DistilBERT 是 BERT 的紧凑变体。它针对情感分类进行了微调。为此,在预训练编码器之上添加了 softmax 分类层。[5 (https://arxiv.org/html/2605.22003#bib.bib9)]。微调在保持计算效率的同时,使上下文嵌入适应情感数据集。性能:准确率 = 0.9259,F1 = 0.9301。

**RoBERTa**:同时,RoBERTa 是 BERT 的优化变体。它也被微调用于情感分析,通过移除下一句预测、使用大批量、动态掩码以及暴露于更多数据,改进整体上下文学习,从而实现更优越的复杂上下文学习。[10 (https://arxiv.org/html/2605.22003#bib.bib10)]。性能:准确率 = 0.9302,F1 = 0.9302。

### IV-C. 软投票集成

为了提高整体准确率,考虑了集成方法。软投票是一种集成方法,其中每个模型通过平均其概率预测进行投票,这种方法带来了好处,并显著提高了准确率。模型阵容:逻辑回归、朴素贝叶斯、SVM、LightGBM、LSTM、DistilBERT 和 RoBERTa。每个模型被赋予相同的权重。然后集成选择具有最高组合分数的类别。

这种方法通过解决模型之间的分歧并处理棘手的评论而大放异彩。通过平均,集成降低了整体方差,并倾向于在所有指标上比单独使用 RoBERTa 获得更好的结果。

对于每个输入评论 **x**,每个模型 *m<sub>i</sub>* 产生一个关于类别的概率分布,如公式 (1) 定义:

*P<sub>m</sub>(c|**x**) = [p<sub>m,1</sub>, p<sub>m,2</sub>, ..., p<sub>m,C</sub>]* (1)

集成通过加权平均组合这些概率,如公式 (2) 所示:

*P<sub>ensemble</sub>(c|**x**) = (1/N) ∑<sub>i=1</sub><sup>N</sup> w<sub>i</sub> · P<sub>m<sub>i</sub></sub>(c|**x**)* (2)

其中 *w<sub>i</sub>* 表示分配给模型 *m<sub>i</sub>* 的权重,且 ∑<sub>i=1</sub><sup>N</sup> w<sub>i</sub> = 1。在此实现中,对所有模型使用了相等的权重 (*w<sub>i</sub> = 1/N*)。

最终的情感预测由公式 (3) 确定:

*ŷ = arg max<sub>c ∈ C</sub> P<sub>ensemble</sub>(c|**x**)* (3)

所有模型都使用精心选择的超参数进行训练,以确保稳定收敛和公平比较。对于传统机器学习模型,生成 TF-IDF 特征,最大词汇量为 10,000,n-gram 范围为 1–3。逻辑回归使用 saga 优化器,迭代 1000 次;多项朴素贝叶斯使用加法平滑;线性 SVM 训练 2000 次迭代。LightGBM 配置为 150 个估计器,学习率 0.05,每棵树 63 个叶子。

对于深度学习方法,使用 Adam 优化器和二元交叉熵损失训练了一个双向 LSTM 模型,具有 64 维嵌入和 64 个 LSTM 单元,训练 4 个 epoch,批量大小为 128。

Transformer 模型,包括 DistilBERT 和 RoBERTa,使用 Hugging Face Transformers 框架进行微调,最大序列长度为 128 个 token,批量大小为 32,权重衰减为 0.01,以及 500 个预热步骤。

**实现细节**:集成模型包含七个不同的分类器:SVM、逻辑回归、朴素贝叶斯、LightGBM、LSTM、DistilBERT 和 RoBERTa。拥有多样化的模型使得集成特别强大和成功:

- **传统模型(SVM、LR、NB、LightGBM)**:通过 TF-IDF 表示捕捉词汇模式和词级特征
- **神经模型(LSTM)**:捕捉序列依赖关系和上下文信息
- **Transformer 模型(DistilBERT、RoBERTa)**:利用上下文嵌入和自注意力机制进行细微理解

软投票方法通过处理个体模型出现分歧的情况展示了其有效性,即在模糊案例上处理得特别好。其机制是平均概率估计,这有助于降低方差并减轻个体模型的偏差。因此,与使用单个最佳模型(RoBERTa)相比,所有指标均提高了 1–3%。

### IV-D. 基于 SHAP 的模型可解释性

为了实现模型透明度,使用了 SHAP(Shapley 加性解释)[11 (https://arxiv.org/html/2605.22003#bib.bib11),8 (https://arxiv.org/html/2605.22003#bib.bib12)]。SHAP 遵循的机制简单来说就是为每个特征分配一个 SHAP 值,表示其对预测的边际贡献。对于 SVM,可解释性是直接的。即,SHAP 值对应于 TF-IDF 特征权重与 SVM 系数的乘积。具有强正系数的词,如“good”、“better”、“excellent”等,有助于正面预测。同时,负系数,例如“boring”、“bad”、“detrimental”,自动有助于负面预测。

然后,对于 Transformer 模型,使用基于扰动的技术应用 SHAP[6 (https://arxiv.org/html/2605.22003#bib.bib13)],这意味着输入句子被系统地掩码。然后,重新评估微调后的模型,并计算 token 级别的归因。对于可视化,如力图和条形图,有影响力的 token(即正面贡献)以红色着色,负面贡献以蓝色着色。

## V. 结果分析

模型性能基于测试数据集进行评估,指标包括**准确率**和 **F1 分数**。相应结果在表 II 中报告。

表 II:情感分析模型的性能

### V-A. 消融研究

进行了一项语义评估研究,以量化情感分析流程中每个单独组件的贡献。该研究考察了预处理技术、特征提取模型和模型特定组件。

参见图 3:逻辑回归和朴素贝叶斯的混淆矩阵。
参见图 4:LightGBM 和 SVM 模型的混淆矩阵。
参见图 5:LSTM 模型的混淆矩阵。
参见图 6:DistilBERT 和 RoBERTa 模型的混淆矩阵。
参见图 7:LightGBM 和 LSTM 模型的 SHAP 特征重要性。
参见图 8:DistilBERT 模型的注意力可视化。
参见图 9:RoBERTa 模型的注意力可视化。

**预处理影响**:高级否定处理机制在传统机器学习模型中产生了最显著的性能提升,F1 分数提高了约 +3.2–4.1%。

**特征提取分析**:采用带有 n-gram 范围 (1–3) 的 TF-IDF 优于基于 unigram 的方法,总体准确率提高了约 3.7–4.0%。

**模型特定组件**:在基于 Transformer 的架构中,RoBERTa 微调期间的动态掩码贡献了额外的 +2.1% 准确率提升,凸显了自适应上下文暴露的好处。

**集成贡献**:软投票集成持续提高了所有错误类别的性能,尤其是在复杂或讽刺的评论上,个体模型表现出互补的优势。值得注意的是,集成将讽刺评论的误分类率降低了约 23%。

表 III:关键消融研究结果(性能影响)

### V-B. 错误分析

尽管模型表现良好,准确率较高,但一些评论仍然被误分类。分析错误揭示了所有模型都存在系统性模式。一些挑战包括:

**复杂否定**:双重否定和跨因果否定难以分类,由于其复杂性因而经常被误分类。例如,短语“not without its advantage”尽管表达了正面情绪,但经常被归类为负面。

**讽刺与反语**:模型在检测讽刺方面能力有限,因为它们很大程度上依赖评论的字面解释。包含诸如“Just what I needed, another terribly wr

相似文章

# 微调长存:针对特定任务的Transformer在Reddit虚假信息回复分类中优于零样本LLM

arXiv cs.CL

# 悉尼科技大学研究人员对比微调 Transformer 与零样本 LLM 在 Reddit 虚假信息回应分类任务中的表现 悉尼科技大学的研究人员对微调 Transformer 模型(DistilBERT、RoBERTa)与零样本 LLM(Llama 系列、Claude、Gemini)在 Reddit 虚假信息回应分类任务中的性能进行了比较,发现微调后的 RoBERTa 达到了 0.62 的宏观 F1 分数,而最佳零样本模型仅为 0.50。研究表明,针对特定任务的微调优于更大规模的通用模型,在检测信念传播方面尤为突出,同时前沿模型中的安全对齐机制可能会对模型性能产生负面影响。