量化基于LLM的公共话语立场分析中的不稳定来源

arXiv cs.CL 论文

摘要

本文提出一个诊断框架,用于在基于LLM的公共话语立场分析中分离预处理流程不稳定性和测量方法不稳定性,发现跨方法的不一致性比流程效应更大且更具系统性,并且聚合指标可能会掩盖这些不稳定性。

arXiv:2607.10846v1 Announce Type: new 摘要:计算社会科学日益依赖自动预处理流程——说话人日志、ASR转录文本清理、句子分割——将原始媒体转换为可分析的文本。当这些流程对同一输入产生不同输出时,会出现两个不同的不稳定来源:预处理流程本身(日志方法、分割规则)和下游测量工具(LLM注释与关键词词典)。我们利用来自五个领域41位公众人物的256个YouTube访谈,比较两种说话人日志流程和两种测量方法,所有方法均针对情感效价与认知情态之间的耦合。我们发现:(1) 预处理流程敏感性集中在视频样本有限的说话人(N ≤ 5);对于四个最佳采样的说话人(N ≥ 16),由流程引起的 $r(\text{neg}, \text{emph})$ 平均绝对变化仅为0.13;(2) 跨方法的不一致性更大且更具系统性——LLM和关键词词典方法对几个采样良好的说话人分配了相反的耦合方向,即使在相同的预处理流程内也是如此;(3) 聚合效价比例高度稳定($|\Delta p(\text{neg})| < 6$个百分点),与流程或方法无关,掩盖了这两种不稳定性来源。本文的贡献在于提出了一个将流程效应与测量效应分离的诊断框架:研究访谈数据中跨维度关系的研究人员应验证其结论对这两种变化来源是否稳健,尤其要关注测量方法的选择。
查看原文
查看缓存全文

缓存时间: 2026/07/14 04:23

# 量化基于LLM的公共话语立场分析中的不稳定性来源
来源:https://arxiv.org/html/2607.10846

###### 摘要

计算社会科学日益依赖自动化的预处理流程——说话人分割、ASR转录清理、句子切分——将原始媒体转化为可分析文本。当这些流程对同一输入产生不同输出时,可能产生两种不同的不稳定性来源:预处理流程本身(分割方法、切分规则)和下游测量工具(LLM标注 vs. 关键词词典)。利用来自五个领域的41位公众人物的256个YouTube访谈,我们比较了两种说话人分割流程和两种测量方法,均针对情感效价与认知模态之间的耦合。我们发现:(1)预处理流程敏感性集中在视频样本有限的说话人上(N≤5);对于四个样本量最大的说话人(N≥16),流程引起的r(neg,emph)平均绝对值变化仅为0.13;(2)跨方法分歧更大且更具系统性——LLM和关键词词典方法对多个样本充足的说话人分配了相反的耦合方向,即便在同一预处理流程内也是如此;(3)聚合的效价比例高度稳定(|Δp(neg)|<6个百分点),掩盖了两种不稳定性来源。本文的贡献在于提供了一个诊断框架,将流程效应与测量效应分离开来:研究人员在研究访谈数据中的跨维度关系时,应验证其结论对两种变异来源均具有稳健性,尤其需关注测量方法的选择。

关键词:流程敏感性、预处理稳健性、说话人分割、LLM标注、关键词词典、情感效价、认知模态、计算社会科学

## 1 引言

计算社会科学(CSS)流程正日益自动化。原始访谈素材在进入任何分析之前,需经过自动语音识别(ASR)、说话人分割、转录清理和句子切分。这些预处理步骤中的每一步都包含着选择——使用哪个ASR引擎、哪种分割方法、哪个句子边界检测器——而每一个选择都可能在最终数据上留下印记。

CSS文献已对标注效度(即LLM生成的标签是否与人类判断一致)给予了大量关注[4, 5]。然而,对于两个上游的不稳定性来源——预处理效度(流程选择是否会改变下游结论)和测量效度(即使应用于相同的预处理文本,标注方法的选择(LLM vs. 关键词词典)是否会导致不同结论)——的关注则远为不足。这两种来源常常被混为一谈,使得难以诊断观察到的不稳定性究竟是源于流程还是测量工具。

我们提出流程敏感性分析作为解决此问题的系统方法:

> 流程敏感性是指在替代的、同样合理的预处理配置下,派生度量指标在每个单元(每位说话人、每个视频)上发生变化,并跨单元聚合以识别预处理选择产生重大影响的条件。

流程敏感性与经典测量误差有三个区别。首先,它依赖于度量指标:聚合均值可能稳定,而跨维度相关性可能符号反转。其次,它非均匀分布:某些说话人或领域可能比其他更为敏感。第三,它与方法交互作用:相同的预处理差异可能对LLM基和词典基的测量产生不同影响。

我们通过一个说话人分割的案例研究来演示流程敏感性分析。使用包含41位公众人物(涵盖金融、学术界、中央银行、地缘政治和媒体领域)的256个YouTube访谈语料库,我们比较了:

1. 1. 两种预处理流程:基于VTT的分割(YouTube字幕 + LLM说话人分类)vs. AssemblyAI基于音频的分割。
2. 2. 两种测量方法:LLM零样本标注(DeepSeek)vs. 关键词词典打分,均应用于相同的效价-模态维度。

然后我们问:预处理选择在多大程度上影响下游结论?答案是否取决于测量方法?

我们的贡献是:

1. 1. 一个双来源诊断框架,将预处理流程效应与测量方法效应分离,并为报告这两种不稳定性来源提供实用建议(第3节、第6节)。
2. 2. 经验证据表明流程敏感性是有限且可预测的。对于四个样本量最大的说话人(16-34个视频),在LLM标注下,平均|Δr|=0.13;较大的Δr值集中在视频≤5个的说话人身上,这些情况下相关性估计本身就不稳定(第5节)。
3. 3. 经验证据表明跨方法不一致是更严重的效度威胁。在49%的案例中,LLM和关键词词典方法在r(neg,emph)的符号上存在分歧,包括样本充足的说话人(Rogoff,17个视频),其中两种方法内部稳定但给出相反的耦合方向,表明即使预处理保持不变,测量选择也可能系统地改变结论(第5.3节)。

## 2 相关工作

### 2.1 CSS中的说话人分割

纯文本的说话人分割利用语言内容而非声学特征来区分说话人。近期工作[1, 2, 3]报告了在简短、结构化的对话中,基于LLM的方法的说话人分割错误率为0-4%。然而,这些验证共享一个共同背景:规律的轮流发言、词汇上不同的说话人角色以及受控的录音条件。它们对CSS研究中典型的长篇、无脚本公共话语的普适性仍有待检验。

### 2.2 基于LLM的语料标注与验证

LLM越来越多地被用于CSS中的零样本标注[4, 6]。Ziems等人[5]将提示敏感性和供应商特定偏差确定为关键问题。我们的工作将验证的必要性向上游推进:我们保持标注质量不变,探究预处理选择本身是否就能改变结论。

### 2.3 预处理稳健性与测量效度

预处理敏感性已在NLP中针对特定任务得到探索——机器翻译评估[9]、可复现性[10]——但尚未系统地与CSS中的下游统计推断联系起来。近期工作已开始研究输入格式选择如何影响基于LLM的标注:Zhao等人[15]表明,对同一篇底层文本,改变上下文长度和文本切分策略可将LLM情感标签偏移5-15个百分点;Liu等人[16]证明,句子级与段落级分块会在细粒度情感分类中产生系统性差异。这些发现表明,引入句子边界伪影(第4节)的同一预处理流程可能会放大测量层面的偏差。经典测量理论[7, 8]提供了理解噪声和偏差的工具,但其标准随机误差模型无法捕捉预处理流程可能引入的结构化、依赖于度量指标的污染[14, 13]。

## 3 诊断不稳定性来源的框架

### 3.1 两种不稳定性来源

设D为包含N个单元(说话人,每个有k_i个访谈视频)的原始数据集。设P_1和P_2为两种预处理流程——从D中提取可分析文本的替代方案。设m为下游度量指标(例如,跨视频的r(neg,emph))。

我们区分两种不稳定性来源:

#### 来源1:预处理流程分歧。

对于每个单元i,流程增量衡量当预处理流程改变时度量指标的变化:

Δ_i^pipeline = m(P_2(D_i)) − m(P_1(D_i))   (1)

我们报告每个单元的绝对增量|Δ_i^pipeline|以及m符号发生反转的单元比例(m(P_1)·m(P_2)<0)。当m是皮尔逊相关系数r时,我们应用Fisher z变换用于推断目的;平均|Δr|值在r空间中报告以方便解释。

#### 来源2:测量方法分歧。

设m^LLM和m^KW表示由不同的测量工具应用于相同预处理文本P(D_i)而计算出的同一度量指标。跨方法分歧是指两种方法估计值之间的绝对差:

Δ_i^method(P) = |m^LLM(P(D_i)) − m^KW(P(D_i))|   (2)

接近零的值表明两种方法在相同的预处理输入上给出等效估计值;较大的值表明由测量驱动的分歧。与衡量单一方法内对预处理敏感性的公式(1)不同,公式(2)衡量单一流程内对测量的敏感性。这两个增量可以直接比较:如果对于一个给定的说话人,Δ_i^method > Δ_i^pipeline,那么对于该说话人,测量选择作为不稳定性来源主导了预处理选择。

### 3.2 分解观察到的变异性

对于从原始数据D计算的任何度量指标m,观察到的总变异可能源于任意一种来源。要诊断哪种来源占主导地位:

1. 1. 在每种测量方法(LLM和关键词)内分别计算Δ_i^pipeline。
2. 2. 在每种预处理流程(VTT和AssemblyAI)内分别计算Δ_i^method。
3. 3. 比较幅度:如果平均而言|Δ_i^pipeline| ≪ |Δ_i^method|,则测量选择是主要的变异性来源。如果相反,则预处理占主导。

我们在第5节至第5.4节中应用此诊断分解。

## 4 数据与预处理

### 4.1 语料库

我们的经验测试平台包含来自五个领域的41位公众人物的256个YouTube访谈视频。表1提供了按领域和说话人的细分。视频通过yt-dlp收集;元数据从YouTube的JSON输出中提取。基于元数据的质量过滤器排除了9个视频(纪录片、第三人称叙述、非英语内容)。另外10个视频少于4个的说话人被排除在相关性分析之外,以避免小样本伪相关(第5.1节)。此语料库在此用作流程敏感性的测试平台,而非作为数据集贡献引入。

表1:按领域和说话人的语料库组成(仅限于视频≥4个的说话人)。
### 4.2 预处理流程

#### 基于VTT的流程。

解析原始YouTube VTT字幕文件以提取带有时间标记的文本段。去重滚动字幕伪影。连续段间隔≥1.5秒形成单独的发言轮次。每个轮次提交给DeepSeek-V4-Flash进行二值“嘉宾”/“主持人”分类(每批20个)。基于内容的预检查标记出字数>500但零第一人称言语标记的视频,视为可能的非访谈内容。将嘉宾文本拼接成最终每视频输出。

#### 基于音频的流程(AssemblyAI)。

我们选择AssemblyAI(商业云API)而非开源替代方案(如pyannote-audio[12] + Whisper)有三个原因:(1) AssemblyAI提供集成的ASR + 带说话人标签的分割,避免了拼接单独ASR和分割输出的工程复杂性;(2) 在我们的长篇访谈数据上的初步测试显示,对于包含重叠语音的多说话人、无脚本内容,AssemblyAI的分割质量远优于pyannote;(3) 基于API的工作流程无需本地GPU资源即可复现,使得没有专用硬件的CSS研究人员也能使用。我们承认商业API会带来成本和可复现性限制;在结论末尾的“未来工作”部分讨论了将比较扩展到开源分割器。音频文件(.m4a)上传到AssemblyAI的API并启用说话人分割。按词计数最多的说话人被识别为嘉宾(对于第二个说话人词占比超过25%的歧义情况,使用LLM后备)。将嘉宾话语拼接成最终每视频输出。

两种流程都产生原始ASR文本,仅在说话人识别机制上有所不同。两种流程产生系统性的不同输出:AssemblyAI检测多说话人结构,嘉宾比例因视频而异,而基于VTT的流程产生更高且变化更小的嘉宾比例,这与主持人语音去除不足一致。没有对任一输出应用基于LLM的文本清理。

### 4.3 句子切分

来自每个流程的嘉宾文本使用正则表达式边界检测切分成句子。句子长度在2-60个词之外的被排除在下游标注之外。表2报告了生成的句子语料库统计信息。两种流程产生明显不同的句子分布:基于VTT的输出更碎片化(平均10.2词/句),反映了YouTube自动生成的字幕切分缺少句尾标点,而AssemblyAI输出形成更长、更连贯的句子(平均15.3词/句)。这一差异意味着观察到的流程敏感性是分割和切分效应的复合体;当前的设计无法完全将它们分离。

表2:句子切分和过滤(2-60个词)后的句子语料库统计信息,仅限于视频≥4个的41位说话人。
### 4.4 LLM标注

来自两种流程的所有句子均通过DeepSeek-V4-Flash(温度0.0)进行标注,标注维度为效价(正面/负面/中性)以及

相似文章

StabilityBench:大语言模型不稳定性基准测试

arXiv cs.LG

StabilityBench 是一个基准测试操作符,它将单轮大语言模型评估转化为包含用户模拟和诱导模块的多轮交互,揭示了当前模型中显著的性能不稳定性,并推动了更真实的评估协议。