通过人口统计条件融合嵌入学习视角主义社会意义

arXiv cs.CL 论文

摘要

本文提出人口统计条件融合嵌入,用于建模语言中的视角主义社会意义,通过将注释者人口统计信息整合到NLP系统中,展现出相对于纯文本基线的持续改进。

arXiv:2606.07123v1 公告类型:新 摘要:语言中的社会意义本质上是视角性的,随着注释者的背景、人口统计特征和意识形态立场而变化。然而,大多数NLP系统将这种变化压缩为一个单一的基准真实标签,忽略了理解的多样性。在这项工作中,我们沿着视角主义光谱对社会维度进行建模,捕捉在一个包含28k人类注释的数据集上不同人口统计群体之间理解的变化。我们对多种建模范式进行了基准测试,包括零样本、少样本和微调方法,并提出了融合文本和人口统计表示的嵌入。我们的融合模型在所有融合策略上均比纯文本基线取得了一致且统计显著的改进(相对宏PR-AUC提高5.9-6.5%),并且通过shuffle消融实验证实人口统计特征携带真实的预测信号而非虚假相关性。
查看原文
查看缓存全文

缓存时间: 2026/06/08 09:22

# 通过人口统计学条件融合嵌入学习视角性社会意义
来源: https://arxiv.org/html/2606.07123
Amanda Cercas Curry 独立研究员 amanda\.cercas@gmail\.com &Lucio La Cava 卡拉布里亚大学 lucio\.lacava@dimes\.unical\.it Luca Maria Aiello 哥本哈根信息技术大学 luai@itu\.dk &Gianmarco De Francisci Morales CENTAI gdfm@acm\.org

###### 摘要

语言中的社会意义本质上是视角性的,会因标注者的背景、人口统计特征和意识形态立场而不同。然而,大多数自然语言处理系统将这种差异压缩为单一的真实标签,忽略了理解的多样性。在这项工作中,我们沿一条*视角性光谱*对社会维度进行建模,捕捉不同人口统计群体在包含 28k 条人类标注的数据集上如何变化。我们基准测试了多种建模范式,包括零样本、少样本和微调方法,并提出了融合文本和人口统计表征的**融合嵌入**。我们的融合模型在所有融合策略上均比仅文本基线取得了持续且统计显著的改进(相对宏平均 PR-AUC 提升 +5.9–6.5%),打乱消融实验确认人口统计档案携带真实的预测信号,而非虚假关联。

通过人口统计学条件融合嵌入学习视角性社会意义

Amanda Cercas Curry 独立研究员 amanda\.cercas@gmail\.com Lucio La Cava 卡拉布里亚大学 lucio\.lacava@dimes\.unical\.it

Luca Maria Aiello 哥本哈根信息技术大学 luai@itu\.dk Gianmarco De Francisci Morales CENTAI gdfm@acm\.org

## 1 引言

社会意义并非固定于文本:它是在阅读行为中构建的。同一句话对一位读者而言可能传达知识分享,对另一位是地位授予,对第三位是支持,这取决于谁在解读以及通过何种文化、人口统计和意识形态棱镜。这种语用意义的视角性本质早已在社会语言学中得到承认[Plank (2022)](https://arxiv.org/html/2606.07123#bib.bib11);[Hovy and Yang (2021)](https://arxiv.org/html/2606.07123#bib.bib13)。然而,大多数自然语言处理系统通过将人类理解的多样性压缩为单一真实标签,将社会标签视为文本的客观属性。

基于数十年的社会科学研究,[Choiet al. (2020)](https://arxiv.org/html/2606.07123#bib.bib21) 将社会互动的十个基本维度——知识、权力、地位、信任、支持、浪漫、相似性、身份、乐趣和冲突——操作化,并表明它们可以从对话文本中可靠检测。他们的框架此后被用于研究在线环境中的一致性、协调性和社区福祉[Montiet al. (2022)](https://arxiv.org/html/2606.07123#bib.bib22);[Lucchiniet al. (2022)](https://arxiv.org/html/2606.07123#bib.bib23);[Aielloet al. (2021)](https://arxiv.org/html/2606.07123#bib.bib24);[Balsamoet al. (2023)](https://arxiv.org/html/2606.07123#bib.bib25)。然而,原始数据集是用同质化的标注者池收集的,仅以聚合形式发布,并未提供标注者人口统计信息,这使得研究不同人群间的理解差异成为不可能。

P1SCO[Curryet al., 2026](https://arxiv.org/html/2606.07123#bib.bib33) 通过引入一个大规模、分门别类的社会维度标注数据集来弥补这一空白,该数据集涵盖三个社交媒体平台(Reddit、YouTube 和 Instagram),由来自美国和英国的 543 名人口统计多样化的参与者贡献。P1SCO 表明性别、年龄、国籍和政治倾向,以及大五人格特质,都与所有十个维度的标签分配相关。关键在于,同质的人口统计群体比整体人群表现出更高的组内一致性,这表明共享的社会经验产生了趋同的解释框架。这些发现为当前工作建立了一个关键前提:在此任务中,标注者分歧并非噪声,而是信号。

在本文中,我们提出疑问:**模型能否学会预测不同人口统计群体如何感知社会维度?**我们将其框架化为一个**视角性预测**任务,其中模型同时接收候选文本和标注者人口统计档案,并必须估计具有该档案的标注者为每个社会维度分配标签的概率。使用 P1SCO 作为我们的评估平台,我们基准测试了一系列建模范式(零样本、少样本和微调),并提出了**人口统计学条件融合嵌入**,在多个深度整合文本和人口统计表征。

实证上,我们发现人口统计条件化持续优于仅文本基线,我们最好的融合模型实现了约 6.5% 的宏平均 PR-AUC 相对提升。打乱消融实验确认这些提升反映了真正信息性的人口统计信号,而非虚假关联。每个标签的分析显示,对于语义模糊的维度,改进最大,权力(相对提升 +51.9%)和信任(相对提升 +30.1%),其中人口统计视角最强烈地介导了理解。

#### 贡献

- • 我们为 P1SCO 上的视角性社会维度预测建立了首个全面基线,基准测试了零样本、少样本和微调范式。
- • 我们提出了在三个整合深度上结合文本和人口统计表征的融合嵌入,在宏平均 PR-AUC 上相对于仅文本模型实现了高达 +6.5% 的提升,所有融合策略均取得了统计显著的增益。
- • 通过打乱消融实验和每个标签分析,我们表明人口统计信号携带真实的预测信息,并且完整的性别-年龄-国籍三元组优于任何单独的人口统计子集。

## 2 任务公式化

设 L 表示十标签集合。对于候选 c,其文本为 x_c,设 R_c 表示对其实施标注的标注者集合,并设 v_{c,l}^{(r)} ∈ {0,1} 为由 r ∈ R_c 为候选 c 和维度 l ∈ L 分配的二元标签,指示社会维度是否存在。

对于任何非空标注者子集 S_c ⊆ R_c,我们将**软分类**目标定义为 S_c 中标注者识别出候选文本 c 中维度 l 的比例:

s_{c,l}(S_c) = \frac{1}{|S_c|} \sum_{r \in S_c} v_{c,l}^{(r)}, (1)

相应的**硬分类**目标为:

y_{c,l}(S_c) = \mathbb{I}[s_{c,l}(S_c) > 0.5]. (2)

具体来说,s_{c,l}(S_c) 指示标注者集合 S_c 内部的一致程度,而 y_{c,l}(S_c) 则指示相应的二元多数版本(精确平局时默认为 0)。

注意,后文中,数据划分始终在候选级别使用**迭代多标签分层**进行,以避免候选内容在划分之间泄露。

#### 多数预测

此任务对应 S_c = R_c 的特殊情况,即考虑所有标注者。对于此任务,我们推导出 s_{c,l}^{maj} = s_{c,l}(R_c) 和 y_{c,l}^{maj} = y_{c,l}(R_c) 多数标签,仅考虑具有至少三个标注的候选。输入为 x_c,输出为每个社会维度的一个概率值。在硬标签设置中,我们使用 y_{c,l}^{maj} 进行评估,而在软标签设置中,我们将模型预测与 s_{c,l}^{maj} 进行比较。

此任务的最终划分包含 3879/550/1104 个训练/验证/测试候选。

#### 视角性预测

此任务设置根据人口统计档案定义标注者子集 S_c。让我们用 m_r = (g_r, a_r, n_r) 表示标注者 r 的人口统计档案,包括 r 的性别、年龄组和国籍,并设 G = (g, a, n) 定义一个作为元组的人口统计群体。对于候选 c,特定群体标注者子集为:

R_c(G) = {r ∈ R_c: m_r = G}. (3)

如果 R_c(G) 非空,我们可以使用上述定义来定义相应的群体特定软硬标签为 s_{c,l}^{(G)} = s_{c,l}(R_c(G)) 和 y_{c,l}^{(G)} = y_{c,l}(R_c(G))。

我们强调,并非将单个标注合并为群体级标注,我们保留每个观察到的标注的记录,利用组内变异性来更好地校准预测。具体而言,任务输入对应于一对 (x_c, m_r),预期输出估计每个标签的 p(v_{c,l}^{(r)}=1 | x_c, m_r)。

注意,对于给定群体 G,此概率对应于 s_{c,l}^{(G)} 的估计,而相应的硬标签可以通过对这些概率进行阈值化获得。

此任务的最终划分包含 19,022/2,691/5,480 个训练/验证/测试候选。

## 3 架构

### 3.1 文本编码器

我们训练以解决社会维度分类任务的主要架构包括一个微调的 RoBERTa-large [Liuet al., 2019](https://arxiv.org/html/2606.07123#bib.bib1),通过 HuggingFace 库实现。让我们用 E 表示编码器,参数集为 θ。对于任何候选输入文本 x_c,我们收集最终层、第一个标记的表示 h_c = E_θ(x_c) ∈ R^H,即 [CLS] 标记,对于 RoBERTa-large,H=1024。

一个小型分类头将此文本表示映射到每个社会维度的一个 logit:

z_c^{text} = C_{text}(h_c) ∈ R^{|L|} (4)

其中 C_{text} 表示标准的 RoBERTa 分类头设计。多数投票社会维度预测直接利用这些 logits,而视角性预测则将其用作仅文本基线。

### 3.2 人口统计编码器

为了编码给定的社会人口统计视角,我们考虑标注者的性别 (g)、年龄组 (a) 和国籍 (n),并将其分别编码为 64 维向量。编码使用 RoBERTa 将特定社会人口统计组的文本表示转换为其嵌入。然后,我们按如下方式投影拼接的表示:

d_r = D_{demo}([e^g(g_r); e^a(a_r); e^n(n_r)]) ∈ R^{128}, (5)

其中 D_{demo} 是一个具有 GELU 激活的两层 MLP。

### 3.3 文本-视角融合模式

为了将社会人口统计信息整合到我们的潜在表示中并获得视角性社会维度分类,我们设计了三种不同深度的融合策略,外加一个基线。

#### 仅文本基线

此方法仅利用文本编码 z^{text},忽略 d_r。注意,由于我们丢弃了社会人口统计条件化,因此对此基线的任何改进都表明社会人口统计整合有助于超越文本内容的预测。

#### 加法融合

此融合模式下的预测获得如下:

z_{c,r}^{add} = z_c^{text} + W_d d_r + b_d, (6)

其中 W_d 和 b_d 是零初始化的,因此模型从人口统计盲开始,仅在训练数据支持的情况下学习群体条件化残差。这代表了最保守的融合策略,因为文本仍然是主要证据,而人口统计信息只能调整标签 logits。

#### 早期融合

此模式在分类之前将池化后的文本表示和社会人口统计编码拼接起来:

z_{c,r}^{early} = C_{early}([h_c; d_r]), (7)

其中 C_{early} 遵循 C_{text} 的分类头设计,但接收文本向量和人口统计向量作为输入。注意,此融合策略可以学习更深的、非加性的文本-人口统计交互。

#### 拼接后编码融合

这代表了最深的整合策略,因为它将人口统计元组置于文本之前,然后再进行分词和编码,例如:

[Female, 25-34, UK] ⟨文本⟩。

拼接后,文本通过仅文本编码器处理;因此此模式不使用第 3.2 节中描述的编码器。在这里,最深的整合源于每个 Transformer 层在编码文本时都有可能关注“条件化”前缀。

### 3.4 训练

鉴于第 2 节中的预测设置和上述架构,训练仅在于哪个目标向量与每个模型输出配对。所有模型为每个社会维度生成一个 logit 和一个概率。我们写 z_c ∈ R^{|L|} 表示候选级 logits,p_c = σ(z_c) ∈ [0,1]^{|L|} 表示相应的概率。因此,p_{cℓ} 是模型认为社会维度 ℓ 适用于候选 c 的概率。对于处理分门别类的单标注标签的模型,我们类似地写 z_c^{(r)} 和 p_c^{(r)} = σ(z_c^{(r)}),其中 p_{c,ℓ}^{(r)} 估计具有档案 m_r 的标注者为候选 c 分配标签 ℓ 的概率。

#### 多数社会维度预测

对于候选级模型,输入是文本 x_c。我们训练三个变体,具有相同的概率输出 p_c:(i) 针对 y_c^{maj} 的硬标签变体,(ii) 针对 s_c^{maj} 的软标签变体,以及 (iii) 后者的一个变体,聚焦于 MSE/Brier 分数以直接优化概率误差。

#### 视角性社会维度预测

对于标注级预测,输入是 (x_c, m_r),模型输出 p_c^{(r)} ∈ [0,1]^{|L|},其中每个分量估计 P(v_{c,ℓ}^{(r)}=1 | x_c, m_r)。

如第 2 节所述,在训练期间,我们使用从单个标注 v_{c,ℓ}^{(r)} 导出的观察标注向量 v_c^{(r)} 作为目标。相反,在推理时,固定 m_r = G 给出一个群体条件化预测 ŝ_c^{(G)} = p_c^{(G)}

相似文章

Fusion Embedding:文本、图像、视频与音频的统一嵌入空间

arXiv cs.CL

Fusion Embedding 引入了一个模型系列,将音频添加至冻结的视觉-语言嵌入主干网络,从而实现文本、图像、视频和音频检索的统一嵌入空间。该系列模型仅训练轻量级适配器,无需配对音视频数据即可实现音频-图像检索。

使用LLM生成的嵌入从社交媒体文本中进行可解释的抑郁症检测

arXiv cs.CL

本文研究了使用大语言模型(LLMs)和监督分类器从社交媒体文本中检测抑郁症的方法,提出了一种基于提示的嵌入方法以增强可解释性。在多个数据集上的实验表明,零样本LLMs在二分类任务中表现良好,但在细粒度严重程度分类上表现不佳;而基于LLM摘要嵌入的监督模型在多分类和有序分类任务中取得了更一致的表现。