# 微调长存:针对特定任务的Transformer在Reddit虚假信息回复分类中优于零样本LLM

arXiv cs.CL 论文

摘要

# 悉尼科技大学研究人员对比微调 Transformer 与零样本 LLM 在 Reddit 虚假信息回应分类任务中的表现 悉尼科技大学的研究人员对微调 Transformer 模型(DistilBERT、RoBERTa)与零样本 LLM(Llama 系列、Claude、Gemini)在 Reddit 虚假信息回应分类任务中的性能进行了比较,发现微调后的 RoBERTa 达到了 0.62 的宏观 F1 分数,而最佳零样本模型仅为 0.50。研究表明,针对特定任务的微调优于更大规模的通用模型,在检测信念传播方面尤为突出,同时前沿模型中的安全对齐机制可能会对模型性能产生负面影响。

arXiv:2606.04274v1 公告类型:新论文 摘要:随着大型语言模型(LLM)逐渐成为在线信息核查的默认工具,一个隐含假设随之而来:规模与通用能力足以对错误信息话语进行细粒度分类。我们直接在900条Reddit评论上验证了这一假设,这些评论涵盖三个经PolitiFact核实的错误信息声明(环境、健康、移民议题),并被标注为"信念"(传播该声明)、"事实核查"(纠正该声明)或"其他"。我们在通用标签模式和主题特定标签模式下,对三种范式共九个模型进行了比较——包括BART-MNLI、三个Llama变体、三个商业前沿LLM(Claude Haiku 4.5、Gemini Flash Lite 2.5、Claude Sonnet 4.6),以及经过微调的DistilBERT和RoBERTa。 结果表明,上述假设并不成立。经微调的RoBERTa在宏平均F₁上达到0.62,而最佳零样本结果(Claude Haiku 4.5)仅为0.50,且前者的单次查询成本仅为后者的一小部分;有监督方法的优势集中体现在"信念"类别上——这一隐性、情感性类别被所有零样本模型普遍检测不足。扩大规模并无助益:Llama-3-8B与Llama-3-70B表现相当,而Claude Sonnet 4.6在通用标签下的表现不及规模更小的Haiku,其信念检测得分骤降至0.17,并对部分被标记为敏感内容的评论直接拒绝作答。这是一种安全对齐的副作用,而非能力上的局限。标签模式与主题共同影响零样本性能,同一模型在相同标签下跨主题的宏平均F₁差异可超过0.13。在信息核查场景中,遗漏"信念"是代价更高的错误,因此尽管大型生成模型持续涌现,针对特定任务的微调仍是更为可靠的选择。
查看原文
查看缓存全文

缓存时间: 2026/06/05 02:13

# 微调长盛不衰:针对特定任务微调的Transformer在Reddit虚假信息回应分类中超越零样本LLM

来源:https://arxiv.org/html/2606.04274

\\fnmLin\\surTian\\fnmAngela\\surBrillantes\\fnmAdriana\-Simona\\surMihăit,ă\\fnmMarian\-Andrei\\surRizoiu\\orgnameUniversity of Technology Sydney,\\orgaddress\\citySydney,\\countryAustralia

###### 摘要

随着大语言模型(LLM)成为网络信息核查的默认工具,一个隐含假设随之而来:规模和通用能力足以对虚假信息话语进行细粒度分类。我们直接对这一假设进行了检验,数据集包含900条Reddit评论,涵盖三个经PolitiFact核实的虚假信息声明(环境、健康、移民),并标注为*belief*(传播该声明)、*fact-check*(纠正该声明)或*other*。我们在通用标签和主题专属标签两种方案下,对三种范式共九个模型进行比较——BART-MNLI、三个Llama变体、三个商业前沿LLM(Claude Haiku 4.5、Gemini Flash Lite 2.5、Claude Sonnet 4.6),以及经过微调的DistilBERT和RoBERTa。结果表明,上述假设并不成立。微调后的RoBERTa达到0.62的宏F1$F_\{1\}$,而最佳零样本结果仅为0.50(Claude Haiku 4.5),且前者的每次查询成本仅为后者的一小部分;监督学习的优势集中于*belief*类别——这一隐性、情感化的类别是所有零样本模型检测能力最薄弱的地方。扩大规模并无帮助:Llama-3-8B与Llama-3-70B表现相当,而Claude Sonnet 4.6在通用标签下表现反而不如较小的Haiku,其belief检测率崩溃至0.17,并对被标记为敏感内容的部分评论直接拒绝回应。这是安全对齐的副作用,而非能力上限。标签方案和主题共同影响零样本性能,同一模型在相同标签下跨主题的宏F1$F_\{1\}$差异可超过0.13。在核查场景下,漏检belief是代价更高的错误,因此尽管大型生成模型层出不穷,针对特定任务的微调仍是更可靠的选择。

###### 关键词:
虚假信息检测、虚假信息回应分类、社交媒体分析、Transformer模型、零样本学习、微调

## 1 引言

大语言模型(LLM)现已嵌入搜索引擎、虚拟助手以及ChatGPT\[1\]、Gemini\[34\]、Claude^1等对话界面之中。当用户遇到可能为假的信息时,他们越来越多地转向这些系统进行核查,而非使用专门的事实核查工具。这种部署模式带有一个隐含假设:规模和通用能力足以对虚假信息话语进行细粒度分类。我们直接对这一假设进行了检验。

当今的零样本LLM——包括最新的商业前沿模型——能否像经过任务专属微调的小型Transformer那样可靠地对虚假信息回应进行分类?

对虚假信息回应进行分类并非易事。社交媒体帖子下的一条评论,可能是在*传播*错误声明(*belief*)、*质疑*它(*fact-check*),或者是中立乃至无关内容(*other*)。厘清这些差异对于理解虚假信息的传播方式以及社区如何对其提出质疑至关重要\[32, 37, 8\]。与情感分类或主题分类不同,该任务需要推断评论者相对于特定声明的*认知立场*,这一判断对标签设计、模型架构以及各主题的话语风格都十分敏感。三个类别在语言层面也存在不对称性:fact-check回应往往带有明确的纠正性标记,如引用证据或直接反驳,而belief则往往是隐性的、情感化的,甚至是反讽式的。这种不对称性在我们的结果中反复出现,使得*belief*类别成为最难检测的类别,也是在核查场景中最不应漏检的类别。

在虚假信息回应与立场分类的相关文献中,两种范式占据主导地位\[2, 25, 14\]:零样本推理\[41, 31\]和监督微调\[10, 23\]。两种零样本架构家族对任务的处理方式各有不同。自然语言推理(NLI)模型(如BART-MNLI\[22\])将每个标签作为假设与输入文本进行对比评估,而生成式LLM\[6, 36\]则通过基于提示的补全来生成类别预测。近期的商业系统将指令微调与安全对齐相结合,而这些特性如何在标签措辞模糊的分类任务中相互作用,目前仍不甚明朗。现有的实证比较要么早于当前商业前沿模型,要么仅孤立地研究其中一种范式。

我们在900条Reddit评论上对九个模型进行比较,涵盖三个经PolitiFact核实的虚假信息声明,各自对应环境、健康和移民议题。零样本设置包括BART-MNLI、三个Llama变体(Llama-3.2-3B、Llama-3-8B、Llama-3-70B)以及三个商业前沿模型(Claude Haiku 4.5、Gemini Flash Lite 2.5、Claude Sonnet 4.6);监督学习设置包括DistilBERT和RoBERTa。我们在两种标签方案条件下进行评估:所有主题共用的通用标签,以及针对各声明量身定制的主题专属标签,采用分层5折交叉验证;对全部900条预测进行置换检验,以提供主要比较的统计显著性。

我们围绕四项实证发现组织分析。第一,标签方案和主题共同影响零样本性能:主题专属标签可显著提升宏F1$F_\{1\}$(例如,在环境主题中从0.31提升至0.54,$\Delta{=}0.23$,$p_\{\text\{Holm\}\}{<}0.01$),但这一提升并不在所有主题上均匀推广,同一模型在相同标签下跨主题的宏F1$F_\{1\}$差异可超过0.13。第二,扩大规模并不总能带来帮助:Llama-3-8B在多个设置中与Llama-3-70B持平或超过后者,而能力更强的Claude Sonnet 4.6在通用标签下反而不如更小的Claude Haiku 4.5(0.42 vs. 0.50)。这一反转源于安全对齐,而非能力不足:Sonnet将belief检测的宏F1$F_\{1\}$压缩至0.17,并对被标记为敏感内容的部分评论直接拒绝回应。第三,监督微调在所有测试的零样本配置中均表现更优,且其优势集中于**belief**类别:RoBERTa达到$F_\{1\}=0.52$,而任何零样本模型在整体性能均衡时的最高结果仅为0.34。第四,BART-MNLI仍是一个强劲的零样本基线:它兼具均衡预测和低推理成本的优势,是在无监督数据可用时的最高效选项。

上述结果指向当前基于LLM的核查中反复出现的一类失效模式:零样本模型——包括专有前沿模型——对传播belief的内容检测不足,而这恰恰是核查中最需要准确识别的类别。微调后的RoBERTa达到0.62的宏F1$F_\{1\}$,远高于最佳零样本结果(0.50),且推理成本和每次查询成本仅为后者的一小部分。尽管大型生成模型迅速普及,针对特定任务的微调仍是一种具有竞争力的策略。

**贡献。** 本文作出以下贡献:

- •**零样本LLM(包括近期商业前沿模型)与微调Transformer在虚假信息回应分类上的正面比较。** 跨三个主题、两种标签方案,并采用基于置换检验的5折交叉验证显著性测试,我们证明微调后的RoBERTa(0.62宏F1$F_\{1\}$)优于所有测试的零样本配置(最佳结果:Claude Haiku 4.5,0.50),且每次查询成本仅为后者的一小部分。这挑战了"规模和通用性足以应对细粒度核查任务"的普遍假设。

- •**监督学习优势集中于belief类别的证据——该类别对核查而言最为重要。** 我们测试的每个零样本模型都存在belief检测不足的问题,而商业安全对齐进一步拉大了差距:Claude Sonnet 4.6在通用标签下的belief $F_\{1\}$崩溃至0.17,并对被标记为敏感内容的部分评论直接拒绝回应。微调在最佳均衡零样本模型的基础上弥合了$\Delta{=}+0.18$的差距,使监督学习的优势延伸至风险更高的类别。

- •**一个经整理并公开发布的900条Reddit评论数据集**,标注了对三个经PolitiFact核实的虚假信息声明(环境、健康和移民各一条)的立场,类别分布均衡,以支持未来对主题依赖性模型行为的研究。^2

## 2 相关工作

虚假信息检测研究横跨自然语言处理和计算社会科学的多个领域,包括针对虚假信息声明的回应分类、谣言核查、基于Transformer的文本分类以及社交媒体话语分析。本节总结与在线讨论中对用户虚假信息回应进行分类最直接相关的先前工作。

### 2.1 虚假信息回应的分类

对用户如何回应虚假信息声明进行分类,与成熟的立场检测领域密切相关,但在范围和分类体系上有所不同。立场检测任务由SemEval-2016 Task 6共享任务\[25\]正式提出,该任务定义了针对特定目标的经典分类框架:*Favour*(支持)、*Against*(反对)和*Neither*(中立)。我们的任务有所不同:我们不是对目标实体的态度进行分类,而是对虚假信息声明的*回应类型*进行分类(belief、fact-check或other)。尽管如此,立场检测仍为本研究提供了重要的方法论基础。该竞赛吸引了众多参赛系统,并凸显了跨目标泛化此类分类任务的难度。后续分析\[26\]表明,立场与情感是相关但不同的现象——这一区别在虚假信息话语中尤为重要,因为讽刺性或反讽性陈述可能表达正面情感,同时却隐性地否定某一声明。

早期神经方法显著推进了立场检测的发展。Augenstein et al.\[2\]引入了条件LSTM编码,对目标与周围文本之间的关系进行建模,证明了依赖目标的表征能够提升立场分类效果。这项工作确立了显式建模声明与回应文本之间关系的重要性——在虚假信息立场检测中,声明可能是隐性而非明确陈述的,这一挑战至今仍是核心难题。

RumourEval共享任务进一步将立场检测研究扩展至虚假信息语境。Derczynski et al.\[9\]针对Twitter对话线程中的谣言回应,提出了SDQC框架——*Support*(支持)、*Deny*(否认)、*Query*(质疑)和*Comment*(评论)。RumourEval数据集包含跨突发新闻事件的数千条标注推文,已成为谣言立场分类的标准基准。后续系统\[21, 12\]探索了神经架构,用于对话结构建模以及联合预测谣言立场与真实性。

关于虚假信息立场检测的综合调查强调了该任务在自动化事实核查流程中日益重要的地位。Hardalov et al.\[14\]综述了基于特征的方法、神经架构和Transformer模型等各类方法,强调立场检测为下游虚假信息核查提供了重要信号。同样,自动化事实核查的综述\[13\]将立场分类描述为识别和分析网络上流传的误导性声明的系统的关键组成部分。

### 2.2 用于虚假信息回应分类的Transformer模型

自然语言处理领域的近期进展主要由Transformer架构推动。BERT\[10\]引入了基于掩码语言建模和下一句预测目标的"预训练—微调"范式,在众多文本分类任务上实现了强劲性能。RoBERTa\[23\]随后证明,通过优化训练流程——包括动态掩码和更大规模的训练语料库——可以显著提升BERT的性能。DistilBERT\[30\]则采用知识蒸馏,生成一个更小更快的模型,同时保留BERT的大部分能力。所得模型体积约缩小40%,速度约提升60%,同时保留约97%的BERT性能,使其在计算效率至关重要的实际应用中尤具吸引力。

另一项相关进展是将自然语言推理模型用于零样本文本分类。Yin et al.\[41\]表明,通过将输入文本视为前提、将候选标签视为假设,可以将分类任务重新表述为文本蕴含问题。在多类型自然语言推理(MNLI)数据集上训练的模型因此无需任务专属训练数据即可执行分类。这一方法是广泛使用的BART-large-MNLI模型\[22\]的基础,该模型已成为零样本分类任务的标准基线。

Transformer模型已被广泛应用于虚假信息检测和立场检测任务。例如,Karande et al.\[19\]将基于BERT的立场特征与文章内容相结合以评估可信度,而Kawintiranon and Singh\[20\]则将外部知识融入基于Transformer的立场模型。其他研究使用层级Transformer架构对谣言讨论中的对话结构进行建模\[42\]。这些工作表明,基于Transformer的表征能够有效捕捉上下文信息,从而提升虚假信息检测任务的性能。

### 2.3 低资源与少样本文本分类

虚假信息研究中反复出现的挑战是标注数据集的稀缺性。对立场或虚假信息标签进行人工标注既耗时又往往需要领域专业知识。因此,有若干

相似文章

用于设备端故障检测的轻量级Transformer模型:资源受限部署的基准研究

arXiv cs.LG

一项基准研究,在三个公开数据集上对比了传统机器学习方法(随机森林、XGBoost、SVM、逻辑回归)与轻量级Transformer变体(DistilBERT、TinyBERT、MobileBERT)在设备端故障检测中的表现。传统机器学习在远小得多的资源占用下实现了有竞争力的准确率,而TinyBERT-4L是最便于部署的Transformer模型。