使政治文本缩放具有可比性:17种算法的基础设施与超参数敏感性

arXiv cs.CL 论文

摘要

本文对17种政治文本缩放算法进行了大规模比较分析,建立了共享基础设施以使其具有可比性,并量化了其对超参数选择的敏感性。研究发现,超参数配置文件通常影响较低,主要影响因素来自语言模型选择、种子关键词和主题数量。

arXiv:2609.17602v1 公告类型:新 摘要:计算文本理想点估计 (CT-IPE) 方法通常被作为命名算法进行比较,但应用它们涉及许多研究者选择,这些选择配置了政治文本如何转换为位置估计。本文认为,CT-IPE 方法最好被理解为可配置的测量管道,而不是固定的估计器。基于一个跨越 17 种 CT-IPE 算法、5,537 次实验运行和约 425 万次左右位置估计的大规模比较实验,我描述了使这些异构方法能够联合执行的共享基础设施,并量化了其估计对替代超参数选择的敏感性。方差分解和基于 SHAP 的敏感性分析表明,对于大多数算法,超参数配置文件通过共享偏移解释了很少的残差方差:17 种算法中有 13 种的 ICC 值低于 0.10。当这种配置文件级别的敏感性存在时,它集中在少数几个重要的研究者选择上,最值得注意的是底层语言或嵌入模型的选择、锚定构念的种子关键词列表以及主题数量。
查看原文
查看缓存全文

缓存时间: 2026/09/17 08:53

# 17种算法的基础设施与超参数敏感性
来源:https://arxiv.org/html/2609.17602

## 使政治文本缩放可比较:17种算法的基础设施与超参数敏感性

帕特里克·帕尔尚  
所属单位:媒体与传播系  
所属单位:慕尼黑大学  
邮箱:[[email protected]](mailto:)

###### 摘要

基于计算文本的理想点估计(CT-IPE)方法通常以命名算法的形式进行比较,但应用这些方法涉及众多研究者选择,这些选择决定了如何将政治文本转化为立场估计。本文认为,CT-IPE方法更应被理解为可配置的测量管道,而非固定估计器。基于一个涵盖17种CT-IPE算法、5,537次实验运行以及约425万左右立场估计的大规模比较实验,我描述了使这些异构方法能够共同执行的共享基础设施,并量化了其估计对替代超参数选择的敏感程度。方差分解和基于SHAP的敏感性分析表明,对于大多数算法,超参数配置通过共享偏移解释的残差方差很小:17种算法中有13种的ICC值低于0.10。当存在此类配置层面的敏感性时,它集中在少数关键的研究者选择上,最显著的是基础语言或嵌入模型的选择、锚定构念的种子关键词列表以及主题数量。

## 1 引言

基于计算文本的理想点估计(CT-IPE),也称为政治文本缩放,旨在从文本中估算数值化的政治立场,最常见的是左右轴等维度(Carroll, 2023;Bafumi et al., 2005)。在过去的三十年里,该领域已从经典的词频模型(如Wordscores(Laver et al., 2003)和Wordfish(Slapin and Proksch, 2008))扩展到主题模型(如Vafa et al., 2020)、基于嵌入的方法(如Rheault and Cochrane, 2020),以及最近的大型语言模型(LLM)方法(如Le Mens and Gallego, 2025)。随着这一领域的发展,方法论研究主要比较算法与人类判断的一致性(Bruinsma and Gemenis, 2019; Hjorth et al., 2015),或更有限地比较算法之间的一致性(Egerod and Klemmensen, 2020)。因此,命名算法已成为方法论研究的核心单元。

然而,应用CT-IPE方法远不止选择一个算法。研究者还必须决定如何操作化政治构念、如何表示文本、如何配置计算模型、如何整合外部信息以及如何估算政治立场。尽管这些选择在各个算法内部有所记录,但它们很少被概念化为跨越异构CT-IPE方法的重复性方法论决策。结果,概念上相似的研究者选择在不同算法间仍然难以识别和比较。这引出了两个研究问题:

#### RQ1:
如何使异构的CT-IPE算法在共享实验基础设施内可共同执行和系统比较?

#### RQ2:
通过对异构CT-IPE算法的系统比较,能发现哪些研究者选择模式?

全文中,“研究者选择”指的是将CT-IPE方法应用于数据时涉及的可配置决策——超参数、构念锚点、模型选择以及相关的管道设置——而非作者选择纳入研究的算法。

为回答这些问题,本文认为CT-IPE方法更应被理解为可配置的测量管道,而非固定估计器。我并非直接比较算法,而是比较配置这些算法的研究者选择。我基于一个大规模计算实验,该实验在共享设计下执行17种CT-IPE算法,描述了使这些异构方法可共同运行的软件基础设施,并利用方差分解和基于SHAP(SHapley Additive exPlanations,见Lundberg and Lee, 2017)的敏感性分析量化了替代超参数设置对最终立场估计的影响强度。

结果表明,对于大多数CT-IPE算法,替代超参数配置通过评估规格空间内的共享偏移所解释的剩余方差很小,并且当存在此类配置层面的敏感性时,它集中在少数关键的研究者选择上。

## 2 CT-IPE中的研究者选择

CT-IPE方法通常以命名算法的形式讨论:Wordscores、Wordfish、Party Embeddings、TBIP、LaMP或其他方法。111为可读性起见,全文仅使用缩写(而非完整算法名称)。附录A(https://arxiv.org/html/2609.17602#A1)提供了所有算法的完整列表,包括其全称、对应缩写和相关论文。这种以算法为中心的术语很有用,但它掩盖了应用CT-IPE的一个重要方法论特征:算法通过研究者选择进行配置。这些选择决定了如何将政治文本转化为立场估计。

我使用术语“研究者选择”或“研究者决策”来指代可能改变估计政治立场的、具有理论或方法论依据的决策。此定义比软件超参数的概念更广泛。一个研究者选择可能通过一个算法内的多个参数实现,并在其他算法中通过不同数量或组合的参数实现。相反,一些实现参数纯粹是技术性的,并不构成实质性的研究者选择。这一观点与机器学习(ML)和自然语言处理(NLP)的研究一致,这些研究表明模型行为不仅取决于学习算法本身,还取决于整个建模管道中的可配置选择(Bouthillier et al., 2021; Yang and Shami, 2020)。因此,下文的分析将超参数视为测量程序的一部分,而非技术实现细节,并在单个研究者选择的层面上进行考察。

## 3 方法

### 3.1 比较实验

为了实证研究研究者选择,我基于一个大规模比较实验,该实验在共享设计下评估CT-IPE算法。实验包括17种无监督和半监督CT-IPE算法,涵盖了Parschan and Jakob (2025)系统综述中确定的四大方法类型:基于词频的方法(类型I)、基于主题建模的方法(类型II)、基于词嵌入的方法(类型III)和基于LLM的方法(类型IV)。纳入的算法是该综述涵盖的无监督和半监督CT-IPE方法(见附录A)。从非文本信号推断意识形态的网络方法(如Barberá et al., 2015)超出了本文基于文本的范围。

这些算法应用于估算来自德国和美国的六个语料库(包括政党纲领、议会演讲和政治推文)中的左右立场(见表1)。这些文本类型是CT-IPE方法最常开发和应用的领域(Parschan and Jakob, 2025)。

表1:数据集概述。每个语料库的政党和文档数量。第3.2节描述了共享实现管道如何使这些异构方法在一个比较设计下共同可执行。

最终实验包含5,537次尝试运行,其中4,565次成功完成,产生约425万个政治立场估计。这些为下文的分析提供了实证基础。运行的汇总统计信息可在附录B中找到。各算法的运行次数差异很大,因为超参数网格的大小不同,并且运行时间成本限制了计算成本高的方法的评估配置数量。每次运行对应于从实验网格中抽取的一个实现参数值配置,这些配置共同实例化了一个特定的研究者选择配置。

评估的规格空间设计得尽可能全面:实现参数及其候选值系统性地源自Parschan and Jakob (2025)的CT-IPE文献综述。尽管如此,不同的实验设计或额外的研究者选择可能会产生不同的敏感性特征。

### 3.2 代码实现

使17种异构的CT-IPE方法在共享比较设计下可执行需要大量的软件工程。这些方法最初是作为具有语料库特定假设、异构API和不兼容输出格式的独立工具开发的。因此,本项目通过算法特定的Python包装器执行所有比较算法,将它们现有的实现连接到共享的语料库、元数据和超参数网格。这些包装器并非旨在重新实现算法或标准化其内部估计逻辑;其目的是使异构方法在保留原生实现的同时可共同运行。

原生算法输出在推理过程中原样保留。仅在分析时,必要时将文档级别的估计聚合到政党-来源单元格,并将估计稳健标准化到共同尺度。下文的敏感性分析使用了这些分析时的转换,但保持每次运行的原生极性不变。222极性是左右量表的方向:哪一端对应左,哪一端对应右。几种无监督估计器仅能确定轴的符号,因此原本相似的运行可能将左翼政党置于两端。原生极性是算法输出的符号。还进行了额外的稳健性检查,使用固定的锚定政党对齐每次运行的极性,使得右锚政党获得更大的值(第4.2节)。这使得原始方法输出与进入方差分解的量保持区别。

并非总能完全逐字复制每个原始实现:一些方法是为特定的语料库、模型版本、API、预处理选择或硬件环境开发的。在精确复制会使更广泛的比较变得不可行的情况下,我对原始设置进行了有界修改。333这些修改在在线仓库的MODIFICATIONS.md中有所记录(附录F)。

三个工程教训对于比较性CT-IPE工作尤为关键。首先,围绕每个原生估计器的轻量级包装器比强制统一的API更易于维护:方法在输入(文档-词矩阵、嵌入、提示、成对排序)上差异太大,无法使用单一接口,但它们仍然可以共享语料库、元数据、日志记录和结果存储。其次,配置验证必须被视为实验记录的一部分。网格中的未知键过去会在执行前被丢弃而非报错;因此,已配置和已执行的条件可能悄然分化。现在未知键在规划时就被拒绝,以确保写入的网格和运行保持一致(见局限性部分)。第三,资源异构性本身就是一种研究者约束:每次配置的运行时间从几秒到几十分钟不等,因此等大小的网格通常不可行,不均匀的执行样本是联合设计的预期属性而非缺陷(附录B)。

用于运行和开发代码的CPU系统配备32个vCPU(AMD EPYC 7H12)和125 GB RAM。用于推理的GPU系统配备一块RTX PRO 6000(96 GB VRAM),CPU和RAM配置相同。这些机器通过https://runpod.io/租用。开发和推理成本共计1,125美元。

总而言之,这个共享执行层回答了RQ1:通过围绕保留的原生实现的算法特定包装器、共享配置网格以及与原生输出分开的分析时标准化,异构CT-IPE算法变得可共同执行和系统比较。

## 4 结果

第4节回答了RQ2。实证分析分两步进行:一个量化配置层面(共同方向)敏感性的方差分解,以及一个基于SHAP的对该共享偏移归因到单个研究者选择的分析。

### 4.1 估计目标与估计

估计在定义的实验背景下进行分析(见表1)。背景包括国家、文本体裁(数据源)、政党、结果粒度444算法是在文档级别还是直接在行动者(政党)级别估算立场。和时间段;555一些半监督算法将时间分片作为输入。当算法使用多个随机种子运行时,种子同样被视为背景因素。文档和行动者级别的分数在每个背景下汇总到政党,并在每个算法内部使用中位数和四分位距进行稳健标准化。分析单位则是一个标准化左右分数,对应于特定背景下、特定超参数配置下的一个政党。

分析对每种算法分别进行。关注的量是在实验设置保持不变的情况下,替代研究者选择对政党分数的影响强度。我将这些选择归组为清理后的超参数配置:定义配置的实质性决策,已排除仅捕捉估计噪声的随机种子和仅重述语料库背景的参数(例如,特定国家的提示前缀)。令 yipc 表示在背景 c 下、配置 i 下政党 p 的标准化左右分数。我估计:

yipc = xc^T β + ui + εipc, (1)

其中 xc 考虑了该算法变化的背景因素,ui 是与配置 i 相关的共享偏移(方差 τ²),εipc 是配置内的剩余变异(方差 σ²)。配置层面的敏感性由共享偏移 ui 的方差 τ² 表征。

相似文章

监督式政治量表分析的架构比较

arXiv cs.CL

本文整合了监督式政治量表分析的最新进展,探讨联合预测意识形态量表以及分类与回归之间的中间地带是否能提升性能。

神经语言模型的缩放规律

OpenAI Blog

基础性实证研究,展示了语言模型性能与模型规模、数据集大小和计算预算之间的幂律缩放关系,对最优训练资源分配和样本效率有重要启示。