超越情感:比较传统NLP与基于LLM的多维分析在政治新闻评估中的应用
摘要
本文比较了基于RoBERTa的情感分析与基于LLM的多维框架分析在政治新闻文章中的应用,发现传统情感分析存在“中性崩溃”问题,而基于LLM的方法能更好地捕捉偏见、耸人听闻和框架效应,适用于社会科学研究。
查看缓存全文
缓存时间: 2026/08/07 07:48
###### 摘要 传统情感分析(SA)模型虽然能有效进行极性分类,但对于政治话语中的修辞、意识形态和框架维度——这些维度是社会科学与人文学科(SSH)研究的核心——所能提供的洞察却十分有限。在本文中,我们对基于 RoBERTa 的情感分析与一个基于 LLM 的多维框架分析平台进行了比较研究,并将其应用于来自 17 家国际媒体的 50 篇政治新闻文章语料。结果揭示了一个我们称之为*中性坍缩*的关键局限:RoBERTa 将 70% 的文章归类为中性,实际上将内容丰富的政治文本压平为一个在分析上无信息的类别。我们发现,在中性分类的文章中,有 23% 其负面情感概率得分超过 0.30。相比之下,基于 LLM 的方法能够捕捉政治偏见的方向与强度、耸动性、情感诉求和政治框架——输出与 SSH 认识论相一致的多维分析结果。我们认为,对于政治媒体分析而言,仅靠传统 SA 是不够的,基于 LLM 的多维框架为 SSH 研究需求提供了一种在认识论上更为充分的计算透镜。 关键词:情感分析、政治框架、LLM、媒体分析、社会科学与人文学科、多维文本分析 ## 1 引言 政治话语的计算分析已日益成为社会科学与人文学科(SSH)研究的核心议题。政治学、媒体研究、传播学和数字人文学者不仅试图理解政治报道中*说了什么*,更关注*如何说*——通过何种修辞框架、带着何种意识形态取向、以及何种情感强度 [8 (https://arxiv.org/html/2608.05155#bib.bib8),17 (https://arxiv.org/html/2608.05155#bib.bib17)]。这些源于框架理论、议程设置研究和批判性话语分析的认识论关切,界定了 SSH 学者如何概念化媒体对公众舆论和政治行为的影响。 情感分析(SA)已被广泛采用为媒体分析的一阶计算工具。基于 Transformer 的模型如 BERT [7 (https://arxiv.org/html/2608.05155#bib.bib7)] 和 RoBERTa [14 (https://arxiv.org/html/2608.05155#bib.bib14)] 在情感分类基准上达到了最先进水平,而像 Cardiff NLP Twitter-RoBERTa 模型 [15 (https://arxiv.org/html/2608.05155#bib.bib15)] 这样的专门变体也常用于计算社会科学研究。然而,这些模型从根本上将文本内容简化为一个三类极性判断——正面、中性或负面——这种简化可能与 SSH 研究者概念化和分析政治话语的方式系统性错位。 大型语言模型(LLM)的出现为计算文本分析与 SSH 研究需求之间架起了一座潜在桥梁。LLM 可以通过提示词执行多维分析,捕捉框架策略、意识形态偏见、耸动性和叙事模式——这些类别直接对应既有的 SSH 分析框架 [10 (https://arxiv.org/html/2608.05155#bib.bib10),21 (https://arxiv.org/html/2608.05155#bib.bib21),19 (https://arxiv.org/html/2608.05155#bib.bib19)]。这为 LLMs4SSH 社区提出了一个关键问题:传统情感分析在多大程度上捕捉到了对 SSH 研究者重要的政治文本维度,而基于 LLM 的方法能否更好地满足这些研究需求? 在本文中,我们通过一项直接的比较研究来回答这个问题。我们将基于 RoBERTa 的情感分析和基于 LLM 的多维分析平台应用于同一语料——来自 17 家国际媒体的 50 篇政治新闻文章。本文的贡献有三点: 1. 1. 我们识别并刻画了一种我们称之为*中性坍缩*的现象——SA 模型系统性地将内容丰富的政治内容归类为“中性”的倾向。 2. 2. 我们通过案例层面的分析展示了这种坍缩如何丢弃对 SSH 研究具有核心分析价值的信息。 3. 3. 我们提供了每种方法所能提供之内容的结构化比较,主张这些工具应互补使用而非替代使用。 ## 2 相关工作 ### 2.1 政治文本中的情感分析 情感分析在 NLP 中有着悠久的轨迹,从基于词典的方法 [12 (https://arxiv.org/html/2608.05155#bib.bib12)] 经由机器学习方法发展到当前的基于 Transformer 的最先进水平 [14 (https://arxiv.org/html/2608.05155#bib.bib14)]。在政治文本分析中,SA 已被应用于围绕选举的社交媒体话语 [4 (https://arxiv.org/html/2608.05155#bib.bib4),5 (https://arxiv.org/html/2608.05155#bib.bib5)]、议会辩论记录 [1 (https://arxiv.org/html/2608.05155#bib.bib1)] 和新闻媒体报道 [11 (https://arxiv.org/html/2608.05155#bib.bib11)]。Cardiff NLP Twitter-RoBERTa 模型 [15 (https://arxiv.org/html/2608.05155#bib.bib15)] 在大约 1.24 亿条推文上进行微调,已成为计算社会科学中被引用最多的 SA 模型之一。 然而,将情感极性作为政治文本分析代理变量的适宜性已受到质疑。Van Atteveldt 等人 [20 (https://arxiv.org/html/2608.05155#bib.bib20)] 对传播学研究中的 SA 方法进行了系统比较,发现自动化方法常常无法捕捉政治新闻中的相关变异。Baden 等人 [2 (https://arxiv.org/html/2608.05155#bib.bib2)] 认为,NLP 工具所测量的内容与传播学研究者所需内容之间的概念鸿沟,是计算社会科学面临的一个根本性方法论挑战。 ### 2.2 框架理论与多维分析 在政治传播中,框架概念——选择并强调感知现实的特定方面以促进某种特定解读 [8 (https://arxiv.org/html/2608.05155#bib.bib8)]——三十多年来一直是一个主导性理论框架。Scheufele [17 (https://arxiv.org/html/2608.05155#bib.bib17)] 区分了媒体框架与个体框架,随后有研究识别出具体的框架装置,包括冲突框架、人情味框架、经济后果框架和道德框架 [18 (https://arxiv.org/html/2608.05155#bib.bib18)]。这些多维分析类别与情感分析的正-中-负三分法几乎毫无相似之处。 NLP 领域已经出现了计算性框架检测方法 [6 (https://arxiv.org/html/2608.05155#bib.bib6),9 (https://arxiv.org/html/2608.05155#bib.bib9)],但通常需要预定义的框架分类体系和带标注的训练数据。有监督框架模型的刚性类别方案可能会遗漏定性 SSH 研究者很容易识别出的涌现性或情境特定性框架。 ### 2.3 用于 SSH 研究的 LLM 近期工作已展示了 LLM 在与 SSH 相关的细腻文本分析任务上的潜力。Gilardi 等人 [10 (https://arxiv.org/html/2608.05155#bib.bib10)] 表明,ChatGPT 在文本分类任务(包括政治立场检测)上可以媲美甚至超越众包标注数据。Ziems 等人 [21 (https://arxiv.org/html/2608.05155#bib.bib21)] 对 LLM 在计算社会科学中的应用进行了全面综述,指出其在灵活多维文本解释方面的能力。Törnberg [19 (https://arxiv.org/html/2608.05155#bib.bib19)] 认为,LLM 通过实现解释性分析——超越预定义类别,提供情境化的文本解读——代表了社会科学文本分析的一种范式转变。 至关重要的是,Bail [3 (https://arxiv.org/html/2608.05155#bib.bib3)] 认为,社会科学需要的是按社会-科学推理方式配置的 AI 工具,而不仅仅是重新利用的 NLP 基准。本研究通过提供 SA 与 SSH 相关分析之间差距的直接经验证据,并展示基于 LLM 的平台如何弥合这一差距,为该讨论做出了贡献。 ## 3 方法论 ### 3.1 语料构建 我们构建了一个包含 50 篇英文政治新闻文章的语料,文章发表于 2025 年 6 月至 7 月,收集自 17 家国际媒体。选择这些媒体时考虑了三个维度的多样性: 1. 1. 地理范围——包括西方英语媒体(BBC、The Guardian、NPR、NYTimes、Fox News、NBC News、CNBC)、欧洲媒体(France 24、Euronews、Politico.eu、Reuters)以及全球南方/其他媒体(Al Jazeera、Iran International、VOA、CAN、WION)。 2. 2. 编辑取向——从通常与中左编辑立场相关联的媒体,到与中右或明确保守立场相关联的媒体。 3. 3. 主题覆盖——涵盖议会治理、外交谈判、选举法、公民权利、地缘政治紧张、移民政策和腐败问题。 这一语料设计反映了 SSH 研究者经常遇到并分析的那种异质性、多来源政治报道。媒体和主题的刻意多样化使其对任何计算分析工具来说都是一个具有挑战性的测试案例。 ### 3.2 RoBERTa 情感分析 对于传统 SA 方法,我们使用了 `cardiffnlp/twitter-roberta-base-sentiment-latest` 模型 [15 (https://arxiv.org/html/2608.05155#bib.bib15)],这是一个 RoBERTa-base 架构(1.25 亿参数)在大约 1.24 亿条推文上微调用于三类情感分类的模型。选择该模型是因为它代表了当前 NLP 研究中被引用最广泛的开源 SA 模型之一。 对于每篇文章,全文被分词并截断至 512 个 token(模型的最大输入长度)。模型通过 softmax 生成三个概率分数——P(negative)、P(neutral)、P(positive)——其中得分最高的类别被指定为优势标签。我们还计算了复合得分 (P(positive)−P(negative)) 和分类边际(前两个最高概率分数之差)来表征模型的置信度。 ### 3.3 基于 LLM 的多维分析 对于多维分析,我们使用了一个实现结构化分析流程的基于 LLM 的平台。与 RoBERTa 的单维极性输出不同,该平台处理完整文章文本(不截断),并按照与既有 SSH 分析类别相对应的多个维度来分析每篇文章。 #### 政治偏见评估。 每篇文章获得一个方向性标签(左、中性、右)以及一个连续强度分数(0–100)。这直接回应了 SSH 的一个核心研究问题——报道的意识形态取向——使用一种既支持类别分析也支持连续分析的表示方式。 #### 耸动性。 一个连续分数(0–100),衡量情感夸张、点击诱饵模式、夸大其词的语言和过度修辞诉求的程度。这一维度对应新闻学研究中关于媒体质量的长期关切 [16 (https://arxiv.org/html/2608.05155#bib.bib16)]。 #### 情感诉求。 一个连续分数(0–100),量化文章采用情感而非理性论证策略的程度。 #### 政治框架。 一个综合分数(0–100),指示政治框架装置的整体强度,包括恐惧诉求、替罪羊化、我们-他们对立二分以及受害者/英雄叙事——这些类别源自框架理论 [8 (https://arxiv.org/html/2608.05155#bib.bib8)] 和宣传分析 [13 (https://arxiv.org/html/2608.05155#bib.bib13)]。系统处理完整文章文本,保留了在文本被截断至 512 个 token 时会丢失的完整论证结构。 ## 4 结果 ### 4.1 RoBERTa 情感分布 最引人注目的发现是中性标签的压倒性主导地位。在 50 篇政治文章中,35 篇(70%)被归类为中性,13 篇(26%)为负面,仅 2 篇(4%)为正面。整个语料的平均概率分数为 P(neg)=0.291(σ=0.244),P(neu)=0.638(σ=0.217),P(pos)=0.070(σ=0.124)。正面类别在整个语料中实际上被压制了。图 1 (https://arxiv.org/html/2608.05155#S4.F1) 展示了这一分布。 [图占位符:面板 A——标签分布条形图(负面 13,中性 35,正面 2)。面板 B——P(neg)、P(neu)、P(pos) 分数分布的箱线图。] 图 1:RoBERTa 情感分类结果。面板 A:标签分布显示中性主导(70%)。面板 B:三个类别的分数分布。 ### 4.2 中性坍缩现象 我们将这种分布模式称为*中性坍缩*:情感模型系统性地将政治新闻文章赋予中性标签的倾向,而这些文章从 SSH 视角看,在框架、偏见和修辞策略上内容十分丰富。中性坍缩之所以发生,是因为新闻写作采用了 hedging(模糊限定)、归因、平衡信源和正式语体等语言特征,情感模型将这些特征解读为缺乏情感极性,即使底层内容承载着重要的意识形态和修辞分量。 这一问题的量化特征由两个发现来刻画。首先,35 篇中性分类文章中有 8 篇(23%)的负面概率分数高于 0.30,表明模型检测到了大量负面内容,但被中性概率以微弱优势压过。其次,分类置信度常常较低:有 3 篇文章(6%)前两个类别之间的边际小于 0.10,6 篇(12%)边际低于 0.15,8 篇(16%)边际低于 0.20。 图 2 (https://arxiv.org/html/2608.05155#S4.F2) 展示了三个典型案例。一篇关于澳大利亚首位女性自由党领袖被罢免的文章(BBC)被赋予中性标签,但负面分数为 0.48,而中性分数为 0.50——边际仅为 0.02。一位分析性别与政治领导力的 SSH 研究者会认为这一“中性”分类具有误导性。同样,关于墨西哥-英国外交紧张(P(neg)=0.43)和法德军事分歧(P(neg)=0.41)的文章也被归类为中性,尽管它们包含大量政治冲突内容。 [图占位符:三张水平条形图,显示 BBC、Guardian 和 Politico.eu 案例的各类别概率,附有边际标注和共同的“全部 分类→ 中性”标题。] 图 2:具有高负面分数的中性分类文章案例研究,展示了决策边界上的中性坍缩。 ### 4.3 跨媒体模式 当情感分数按媒体区域汇总时,RoBERTa 在负面维度上揭示了一些有限但值得注意的模式。欧洲媒体(mean P(neg)=0.374)得分最高,其次是西方英语媒体(0.293)和全球南方/其他媒体(0.258)。然而,正面维度几乎没有跨媒体变异,而中性标签则
相似文章
主题情感是否影响感知的意识形态?人类与LLM对政治新闻文章标注的比较
本文探讨了主题情感是否对新闻文章中感知到的政治意识形态产生因果影响,比较了来自 AllSides 的人类标注与来自包括 GPT-4o-mini 和 Llama-3.3-70B 在内的 LLM 标注。研究发现,微调后的 GPT-4o-mini 表现出一种虚假的情感-意识形态耦合,而这种耦合在人类判断中并不存在,这凸显了在因果分析中使用 LLM 标注作为代理的风险。
面向多模态情感分析的语义对齐结构抽象
本文提出了SentiLLM,一个利用语义对齐结构抽象将非语言模态提炼为类文本标记的框架,用于基于大语言模型的多模态情感分析。它引入了一种双流显著性-上下文校准机制,并在四个数据集上取得了优越的性能。
Sympathetic Framing: Evaluating AI Alignment across Sociodemographic Groups
This paper empirically evaluates how well LLMs align with human emotional perception of news framing, using a YouGov survey of 3,011 UK adults and seven LLMs assessing sympathy in headlines. It finds that alignment varies across models and demographic subgroups, highlighting the importance of differential alignment for AI development.
用于令牌高效且语义保持的观点摘要的大语言模型
本文提出一个利用大语言模型进行观点摘要的框架,该框架结合多维分类和分层采样,在降低令牌使用量的同时保持语义多样性和观点间的平衡。
评估LLM在高效可解释的产品需求度数值与分类隐式情感分析中的应用
本文提出一个可扩展的框架,利用LLM对定性反馈中的产品需求度进行隐式情感分析,实现了高达0.97的皮尔逊相关系数和94%的准确率,并提供解释,其中GPT-4o-mini在成本降低94%的情况下实现了相似的性能。