监督式政治量表分析的架构比较
摘要
本文整合了监督式政治量表分析的最新进展,探讨联合预测意识形态量表以及分类与回归之间的中间地带是否能提升性能。
arXiv:2607.01464v1 公告类型:新
摘要:文本量表分析(Text scaling)是政治分析中的一项基本任务,旨在将政治行为者置于意识形态的量表上。为减轻人工分析的需求,各种 NLP 方法已被提出,包括基于分类和回归的方法,这些方法既展示了成功也暴露了局限。本文的目标是整合该领域的最新技术。我们提出两个问题:(a)联合预测量表而非单独预测是否能提升量表分析方法的性能?(b)分类与回归之间是否存在中间地带?
查看缓存全文
缓存时间: 2026/07/03 05:40
# 比较监督式政治立场标定架构
来源:https://arxiv.org/html/2607.01464
塞巴斯蒂安·帕多
斯图加特大学自然语言处理研究所(IMS),德国
\{anna\.golub,sebastian\.pado\}@ims\.uni\-stuttgart\.de
###### 摘要
文本标定(即根据意识形态尺度对政治行动者进行定位)是政治分析中的一项基本任务。为了减少人工分析的需求,研究者提出了多种自然语言处理方法,包括基于分类和基于回归的方法,这些方法既展现了成功也暴露了局限性。本文旨在整合该领域的最新研究进展。我们探讨两个问题:(a)通过联合预测而非单独预测尺度,能否提升标定方法的性能?(b)分类与回归之间是否存在中间地带?
## 1 引言
文本标定——从书面文件或演讲中提取政治行动者的立场,并将其映射到意识形态轴上的分值——是政治文本分析中的一项基础任务(Laver 等,2003(https://arxiv.org/html/2607.01464#bib.bib15))。以这种方式表示政党立场,可以定量衡量它们之间的差异,这有助于理解选举期间选民的行为以及政党执政后的策略(Benoit 和 Laver,2006(https://arxiv.org/html/2607.01464#bib.bib7))。确定政党立场的黄金标准具有挑战性。最著名的来源之一是基于直接咨询专家的“教堂山专家调查”(Rovny 等,2025(https://arxiv.org/html/2607.01464#bib.bib6))。另一种方案由“政治代表宣言研究”(MARPOR)项目¹ 采用。MARPOR 将政党定位直接扎根于文本,收集了超过 3200 份宣言(被视为政党政策最全面的来源),并根据细粒度的本体对其中的政治陈述进行标注。通过汇总类别频率即可获得整体政党立场(详见第 2 节)。由此产生的最著名尺度是 RILE(标准左右尺度),主要反映经济政策立场(Volkens 等,2013(https://arxiv.org/html/2607.01464#bib.bib9);Budge,2013(https://arxiv.org/html/2607.01464#bib.bib8))。
为了降低黄金标准创建的成本,可借助自然语言处理方法自动估计分值。早期基于词频的统计方法(Laver 等,2003(https://arxiv.org/html/2607.01464#bib.bib15);Slapin 和 Proksch,2008(https://arxiv.org/html/2607.01464#bib.bib16))已经揭示了计算机方法估算政党立场的潜力。随后,分布语义学方法(Glavaš 等,2017(https://arxiv.org/html/2607.01464#bib.bib22);Rheault 和 Cochrane,2020(https://arxiv.org/html/2607.01464#bib.bib23))、基于 Transformer 的句子嵌入(Ceron 等,2022(https://arxiv.org/html/2607.01464#bib.bib25);Nikolaev 等,2023(https://arxiv.org/html/2607.01464#bib.bib14))以及大语言模型(Benoit 等,2025(https://arxiv.org/html/2607.01464#bib.bib63))进一步拓展并改进了这些结果。这些研究的结果令人鼓舞,但远非完美,揭示了政治标定任务普遍存在的两个相互关联的问题。第一个是**文档长度**:政治文件(如选举宣言)通常包含数千个句子,因此对当前的 Transformer 模型来说过长,无法一次性处理,需要以某种方式进行分割。第二个是**单尺度预测**:尽管政治科学领域广泛共识认为需要多个尺度才能充分捕捉政党立场(Koedam 等,2025(https://arxiv.org/html/2607.01464#bib.bib5)),但大多数计算工作集中在单一尺度(主要是 RILE)的定位上。因此,模型可能不得不学习忽略输入中的大量信息,而不是加以利用。
为了解决这些不足,我们系统比较了不同方法的性能,重点关注两个研究问题:
**RQ1:联合预测能否改善标定效果?**
GAL-TAN 尺度(从绿色-替代-自由主义到传统-威权-民族主义极端,Marks 和 Steenbergen, 2004(https://arxiv.org/html/2607.01464#bib.bib54))捕捉了社会文化观点,补充了 RILE 的经济视角。然而,据我们所知,目前尚无预测 GAL-TAN 立场的研究。此外,尽管理论上两者正交,但经验上 RILE 和 GAL-TAN 分值常常相互依赖:左翼政党倾向于支持 GAL 社会政策,右翼观点往往与 TAN 共存,而另外两种组合则少得多(Jahn, 2011(https://arxiv.org/html/2607.01464#bib.bib57);Brigevich 和 Smith, 2017(https://arxiv.org/html/2607.01464#bib.bib1);Wagner 等,2021(https://arxiv.org/html/2607.01464#bib.bib52))。基于此,我们研究联合预测 RILE 和 GAL-TAN 的模型能否提升结果。
**RQ2:如何处理长输入文档?**
传统研究遵循 MARPOR 方法,构建一个流水线:首先对单个句子进行分类,然后将类别频率聚合为尺度位置(标签聚合)。Nikolaev 等(2023(https://arxiv.org/html/2607.01464#bib.bib14))也训练 Transformer 模型直接通过回归头预测尺度位置,但仍需将输入分割成更小的块进行处理(块级回归)。这两种方法之间的权衡尚未充分探索。值得注意的是,**块大小**是此方法的关键超参数,尚未得到研究。图 1(https://arxiv.org/html/2607.01464#S1.F1)展示了由此产生的实验设计。
针对 RQ1,我们发现 GAL-TAN 的预测效果与 RILE 相当,但联合预测并未提升性能。针对 RQ2,我们确定,有点出乎意料的是,块大小对性能影响甚微,从而在回归和分类之间形成了一个连续体。我们将公开代码。
## 2 方法
### 2.1 标签聚合
模仿 MARPOR 编码方案的简化版本,标签聚合(Nikolaev 等,2023(https://arxiv.org/html/2607.01464#bib.bib14))通过句子分类预测 RILE 分值。预训练的 Transformer 编码器生成句子嵌入,输入分类头,输出“右”、“左”或“其他”之一。模型使用交叉熵损失进行训练。黄金标准类别根据文献(Marks 和 Steenbergen, 2004(https://arxiv.org/html/2607.01464#bib.bib54);Volkens 等,2013(https://arxiv.org/html/2607.01464#bib.bib9))从细粒度的 MARPOR 句子标注中导出。利用公式 (1)(https://arxiv.org/html/2607.01464#S2.E1),句子级预测被聚合为宣言级位置,范围从 -1(极左)到 +1(极右):
RILE = (R − L) / (R + L + O) (1)
其中 R、L 和 O 分别是类别为“右”、“左”和“其他”的句子数量。这种方法可以通过将 RILE 特定类别替换为 (G)AL、(T)AN 和 (O)ther 扩展到 GAL-TAN 分值估计,并使用公式 (2)(https://arxiv.org/html/2607.01464#S2.E2)聚合预测:
GAL−TAN = (G − T) / (G + T + O) (2)
我们将此方法称为**标签聚合—单独预测**,因为它独立估算 RILE 和 GAL-TAN。
### 2.2 块级回归
或者,预测任务可以操作化为回归,即模型直接将宣言映射到 [−1, 1] 范围内的分值(Nikolaev 等,2023(https://arxiv.org/html/2607.01464#bib.bib14))。虽然关于稳健处理长输入的研究持续进行(Alva Principe 等,2025(https://arxiv.org/html/2607.01464#bib.bib4)),但当前最先进的 Transformer 编码器的上下文窗口远不足以容纳整份宣言。不过,某些编码器允许输入最多 8192 个 token(Warner 等,2025(https://arxiv.org/html/2607.01464#bib.bib18)),或超过 650 个 MARPOR 句子,因此可以通过块级处理近似直接预测。具体来说,将给定的宣言按最大允许长度分割成块,然后预训练编码器生成块嵌入,训练在其之上的回归头输出每个块的分值。模型使用 MSE 损失训练,块内的黄金标准分值通过聚合该块内的句子标签(公式 (1))计算。推理时,整份宣言的分值估计为其组成块分值的平均值。与标签聚合类似,**块级回归—单独预测**同样可用于预测 RILE 和 GAL-TAN 分值。
### 2.3 联合建模
我们尝试两种策略从单独预测走向联合预测(RQ1)。
#### 多任务训练
在多任务优化方法(如多目标优化、对抗学习或神经架构搜索)中,最广泛使用的是**标量化**,即联合损失是各任务损失的线性组合(Yu 等,2025(https://arxiv.org/html/2607.01464#bib.bib10))。为将标量化应用于标签聚合和块级回归,每个预训练编码器通过两个分类或回归头进行微调,一个针对 RILE,一个针对 GAL-TAN。联合预测损失函数是各自交叉熵或 MSE 函数之和。RILE 和 GAL-TAN 项权重相等,因为两者无隐含的优劣之分,且由相同数量的数据点表示。由于 RILE 和 GAL-TAN 分值相关,多任务训练有望优于单独预测,因为编码器权重的梯度指向同时最小化两个损失项的方向。
#### 对比训练
作为多任务训练的替代方案,我们使用对比目标联合训练标签聚合编码器。我们采用**三元组损失**(Schroff 等,2015(https://arxiv.org/html/2607.01464#bib.bib11))作为目标函数,旨在将相似实例在嵌入空间中拉近,同时将不相似实例推远。此方法例如用于调整 SBERT(句子 BERT)架构(Reimers 和 Gurevych, 2019(https://arxiv.org/html/2607.01464#bib.bib20))。训练数据以三元组形式处理:一个锚点概念 a,一个与 a 同类的正例概念 p,以及一个来自不同类别的负例概念 n。三元组损失旨在将 a 与 p 之间的距离减小到零,同时将 a 与 n 之间的距离增加到至少 ε:
max(‖S_a − S_p‖ − ‖S_a − S_n‖ + ε, 0) (3)
其中 S_a、S_p、S_n 是 a、p、n 的向量表示;‖·‖ 是距离度量。我们采用以下两种三元组挖掘策略:
1. **RILE 和 GAL-TAN 类别**:随机选择数据点,使得 a 和 p 属于相同的 RILE 和相同的 GAL-TAN 类别,而 n 至少在其中一个标签上不同。这种采样策略延续了 RILE 和 GAL-TAN 类别相互依赖的观点,以及每个组合应在句子嵌入空间中占据独立聚类的想法。
2. **政党**:选择三元组,使得锚点 a 和正例 p 来自同一政党的宣言句子,而负例 n 由不同政党撰写。当使用基于政党的三元组损失对 MARPOR 句子进行微调时,SBERT 在成对政党相似性估计上表现最佳(Ceron 等,2022(https://arxiv.org/html/2607.01464#bib.bib25))。总体而言,基于政党的三元组使编码器能够学习宣言文本的一般性质,这有助于在政治轴上定位政党。
对比调整后,编码器权重被冻结,并在其之上训练两个分类头以预测 RILE 和 GAL-TAN 类别。此外,在将嵌入输入分类头之前,使用**白化变换**(Su 等,2021(https://arxiv.org/html/2607.01464#bib.bib28))对其进行归一化,已知这能减少嵌入的各向异性并提升多种自然语言处理任务的性能(Su 等,2021(https://arxiv.org/html/2607.01464#bib.bib28)),包括成对政党相似性估计(Ceron 等,2022(https://arxiv.org/html/2607.01464#bib.bib25))。
### 2.4 大语言模型基线
近期工作(Le Mens 和 Gallego, 2025(https://arxiv.org/html/2607.01464#bib.bib65);Ornstein 等,2025(https://arxiv.org/html/2607.01464#bib.bib64);Benoit 等,2025(https://arxiv.org/html/2607.01464#bib.bib63))发现,大语言模型在政治标定上与基于嵌入的方法表现相当。因此,我们在实验中包含一个大语言模型来实现标签聚合方法。我们提示大语言模型将给定句子标注为“右”、“左”或“其他”,并使用公式 (1)(https://arxiv.org/html/2607.01464#S2.E1)估算宣言的 RILE 分值。GAL-TAN 单独预测类似处理。我们通过在一个提示中要求同时分配 RILE 和 GAL-TAN 类别来评估联合预测能力。我们称此方法为“基线”,因为我们未对提示进行优化。
## 3 实验设置
### 3.1 数据
实验中,我们采用 Nikolaev 等(2023(https://arxiv.org/html/2607.01464#bib.bib14))的 **X-time(新旧对比)** 设置。该数据集主要测试标定模型随时间推移的泛化能力,即从当前选举周期到未来周期,在训练期间见过的国家中进行测试。所有模型均在 2000–2018 年的 1005 份 MARPOR 宣言(超过 100 万个句子)上训练。对于每个单独训练设置,随机选择其中 10% 的数据保留作验证。2019–2023 年的可用数据(147 份宣言,16.3 万个句子)用于测试。2000 年之前的数据因标注不一致而被排除。模型输入是 Nikolaev 等(2023(https://arxiv.org/html/2607.01464#bib.bib14))² 使用 EasyNMT ³ 中 Opus-MT 模型创建的原宣言文本翻译版本。Nikolaev 等(2023(https://arxiv.org/html/2607.01464#bib.bib14))比较了使用机器翻译与多语言模型,发现结果几乎相同。
### 3.2 标签聚合
遵循 Nikolaev 等(2023(https://arxiv.org/html/2607.01464#bib.bib14)),我们使用顶部带分类头的文本编码器。我们比较两种编码器:SBERT 和 ModernBERT。联合版本具有两个结构上相同的头,每个尺度一个(参见第 2.3 节(https://arxiv.org/html/2607.01464#S2.SS3))。
---
² https://osf.io/aypxd/overview
³ https://github.com/UKPLab/EasyNMT相似文章
使政治文本缩放具有可比性:17种算法的基础设施与超参数敏感性
本文对17种政治文本缩放算法进行了大规模比较分析,建立了共享基础设施以使其具有可比性,并量化了其对超参数选择的敏感性。研究发现,超参数配置文件通常影响较低,主要影响因素来自语言模型选择、种子关键词和主题数量。
架构而非规模:大语言模型中的电路局部化
本文挑战了“随着模型规模扩大,机制可解释性变得愈发困难”的假设,表明架构(特别是分组查询注意力与多头注意力之间的差异)对电路局部化和稳定性的影响比参数量更为关键。
Coupled Scaling: 神经缩放定律的表示可访问性框架
本文介绍了 Coupled Scaling,一个任务条件框架,用于解释神经缩放定律如何根据任务结构与架构优化系统可访问的几何表示之间的关系而变化。
语言模型中的跨架构引导迁移:一项系统性实证研究
一项系统性实证研究显示,当规模足够(≥1.7B参数)时,从一种语言模型中提取的概念方向可以引导其他独立训练的模型,为柏拉图式表征假说提供了功能上的证据,并突显了跨模型可解释性工具的规模阈值。
政治可塑性:大型语言模型中意识形态适应性的分析
本研究论文分析了大型语言模型中的“政治可塑性”,发现当提供用户示例时,较新的模型展现出可靠的意识形态适应性,而较旧的模型则表现出有限或不稳定的反应。