UCSC NLP at SemEval-2026 Task 10:基于边界感知的跨度抽取与RoBERTa分类的阴谋论检测
摘要
本文介绍了UCSC NLP在SemEval-2026 Task 10(PsyCoMark)中使用的系统,针对阴谋论标记提取采用了基于边界感知的跨度抽取与RoBERTa,以及文档级别的阴谋论分类(含标签平滑)。该系统在子任务1中排名第7,在子任务2中排名第12。
查看缓存全文
缓存时间: 2026/07/08 04:41
# UCSC NLP 在 SemEval-2026 任务 10 中的表现:边界感知跨度提取与 RoBERTa 分类用于阴谋检测
来源:https://arxiv.org/html/2607.05689
Dom Marhoefer 加州大学圣克鲁兹分校 dmarhoef@ucsc\.edu & Milos Suvakovic 加州大学圣克鲁兹分校 msuvakov@ucsc\.edu & Glenn Grant\-Richards 加州大学圣克鲁兹分校 ggranri@ucsc\.edu
###### 摘要
我们介绍了为 SemEval\-2026 任务 10(PsyCoMark)设计的系统,该任务涉及阴谋标记提取(子任务 1)和文档级阴谋检测(子任务 2)。对于标记提取,我们将任务建模为对枚举候选跨度的多标签跨度分类,采用 IoU≥0.95 的正例标注策略、难负例采样以及基于包含关系的非极大值抑制(NMS)与边界感知跨度表示。文档分类则独立建模,使用带有标签平滑的序列分类器和分层训练-验证集划分。分析表明,类似实体的角色(行为者、受害者)检测鲁棒性较强,而抽象角色(行为、影响、证据)仍对边界标准敏感。在官方测试集上,我们的系统在子任务 1 中排名第 7(宏 F1 为 0.2251),在子任务 2 中排名第 12(加权 F1 为 0.7694)。
UCSC NLP 在 SemEval\-2026 任务 10 中的表现:边界感知跨度提取与 RoBERTa 分类用于阴谋检测
Dom Marhoefer 加州大学圣克鲁兹分校 dmarhoef@ucsc\.edu & Milos Suvakovic 加州大学圣克鲁兹分校 msuvakov@ucsc\.edu & Glenn Grant\-Richards 加州大学圣克鲁兹分校 ggranri@ucsc\.edu
Aidan Pinero 加州大学圣克鲁兹分校 apinero@ucsc\.edu & Ryan King 加州大学圣克鲁兹分校 rytking@ucsc\.edu
## 1 引言
阴谋叙事通常通过反复出现的叙事角色来描述:一个感知到的行为者(Actor)对受害者(Victim)实施行为(Action),以证据(Evidence)为理由,并产生有害的影响(Effect)。SemEval\-2026 任务 10(PsyCoMark)通过两个子任务将这一视角付诸实践:从文本中提取阴谋角色,以及判断文档是否表达了阴谋叙事(Samory 等人,2026 (https://arxiv.org/html/2607.05689#bib.bib4))。
- •子任务 1:阴谋标记提取。对于给定文档,系统预测对应五个语义角色(行为者、行为、影响、证据、受害者)的标记化跨度。输出是每个文档的一组标记,格式为 \{类型, 起始位置, 结束位置\}。
- •子任务 2:文档级阴谋分类。每个文档被分配三个标签之一(是、否、无法判断)。
PsyCoMark 子任务的一个核心特点是,上述定义的角色结构既出现在阴谋性话语中,也出现在非阴谋性话语(批判性叙事)中。标记为“非阴谋”的文档可能包含完整的“行为者–行为–受害者”结构,但并无阴谋意图;而阴谋性文档则主要在框架和认知立场上有所不同。因此,标记提取与阴谋检测本质上是相关但不等同的:成功既需要对抽象语义角色的精确边界识别,又需要对文档级立场进行建模。
对于子任务 1,我们采用对枚举候选跨度的多标签跨度分类,配合 IoU≥0.95 的正例标注、难负例挖掘和基于包含关系的非极大值抑制(NMS);对于子任务 2,我们使用带有标签平滑的文档分类器和分层训练-验证集划分。在 SemEval 评估服务器上,我们的最佳提交在子任务 1 中排名第 7(宏 F1 为 0.2251),在子任务 2 中排名第 12(加权 F1 为 0.7694)。两个模型相对于其他共享任务提交均取得了有竞争力的性能。
分析表明,边界敏感性仍然是抽象角色(行为、影响、证据)的主要失效模式,尤其是在更严格的词级重叠标准下。类似实体的角色(行为者、受害者)则相对稳健,这表明语义抽象度和可变跨度长度主导了标记难度,而非主题内容。
## 2 背景与任务设置
### 2.1 PsyCoMark 任务与数据
##### 数据集特征。
PsyCoMark 语料库包含来自 190 多个子论坛的 4,100 多条英文 Reddit 提交陈述(Samory 等人,2026 (https://arxiv.org/html/2607.05689#bib.bib4))。文档级阴谋标签存在中等程度的不平衡:35.3% 为“是”,46.6% 为“否”,18.1% 为“无法判断”。标注密度较高:大多数文档至少包含一个心理语言学标记,且许多文档包含多种角色类型。
一个**非阴谋**示例包含多个标记但不支持阴谋:
> “\[德国\]行为者(Actor)已经使\[其他\]受害者(Victim)欧盟成员国感到\[不安\]行为(Action),根据\[一份\]证据(Evidence)报告,通过确保获得该集团公共疫苗库中\[不成比例\]影响(Effect)大的份额……”
相比之下,一个**阴谋性**文档则表达了阴谋性框架:
> “所以\[他们\]行为者(Actor)想让我们相信这是一起\[自杀\]影响(Effect),而\[这\]证据(Evidence)是如此明显不是……仅仅因为\[杰弗里\]受害者(Victim)死了并不意味着事情就此结束……他当时\[处于自杀监视下\]行为(Action)……”
这种角色结构在标签间的重叠使得标记提取与阴谋分类既内在关联又非等同。
### 2.2 相关工作与建模动机
##### 心理语言学结构。
阴谋思维与模式寻求、感知威胁和刻意情节框架相关(Wood 等人,2012 (https://arxiv.org/html/2607.05689#bib.bib17);van Prooijen and Douglas,2017 (https://arxiv.org/html/2607.05689#bib.bib19))。从语言学角度来看,这通常表现为对立性话语和内群体与外群体的框架(Korenčić 等人,2024 (https://arxiv.org/html/2607.05689#bib.bib6)),这可以从计算上区分阴谋叙事与批判性叙事。这些发现表明,阴谋叙事表现出反复出现的语义角色结构,而非纯粹的主题内容,从而激励了显式建模角色(如行为者、受害者、证据)的方法。
##### 计算方法。
先前的工作已经融入了心理语言学特征,例如基于 LIWC 的词汇类别(Tausczik and Pennebaker,2010 (https://arxiv.org/html/2607.05689#bib.bib25))以及更广泛的心理语言学特征来识别阴谋传播者(Giachanou 等人,2023 (https://arxiv.org/html/2607.05689#bib.bib24)),或者微调神经模型用于文档级阴谋分类(Liu 等人,2025 (https://arxiv.org/html/2607.05689#bib.bib30))。结合情感或道德框架特征的混合系统也被探索过(George 等人,2024 (https://arxiv.org/html/2607.05689#bib.bib27))。虽然这些特征提供了关于认知立场的间接线索,但它们并未显式表示叙事角色关系。
为了分析这些关系,基于跨度的分类已广泛应用于信息提取任务,如共指消解和语义角色标注,其中枚举候选跨度能够对重叠和可变长度结构进行建模(Lee 等人,2017 (https://arxiv.org/html/2607.05689#bib.bib5))。
## 3 系统概述
我们使用两个独立的 RoBERTa-large(Liu 等人,2019 (https://arxiv.org/html/2607.05689#bib.bib1))模型来解决 PsyCoMark 任务,每个子任务一个模型。我们没有融入外部心理语言学特征,而是直接从 PsyCoMark 标注提供的跨度级监督中学习角色表示。子任务 1 被建模为对枚举候选跨度的多标签分类,并通过后处理来解决重叠和嵌套预测问题。子任务 2 被建模为对完整文档文本的标准序列分类。我们分别训练这两个模型,不进行参数共享或跨任务特征迁移;输出仅合并以匹配所需的提交格式。实验在单个 NVIDIA A100 GPU 和单个 RTX-4070 GPU 上进行,使用 PyTorch 2.10 和 Hugging Face Transformers 5.1。
### 3.1 子任务 1:阴谋标记提取
#### 3.1.1 架构
PsyCoMark 跨度提取的一个关键挑战在于,对于语义抽象、多词且长度在不同上下文中变化很大的角色进行精确边界定位。我们将阴谋标记提取建模为跨度分类,而不是词级标注。给定一个分词后的文档,我们枚举所有长度不超过 L=32 个 token(为效率而选)的候选跨度。每个候选跨度 (i,j) 被独立地分类到一个或多个语义角色。
对于每个跨度 (i,j),我们通过拼接六个组件来构建上下文表示 v_span:
v_span = [h_i; h_j; ĥ_{i:j}; w_emb; h_{i-1}; h_{j+1}]
其中:
- • h_i, h_j ∈ R^H:跨度起始和结束 token 的上下文化嵌入。
- • ĥ_{i:j} ∈ R^H:跨度内 token 的平均池化上下文化嵌入。
- • w_emb ∈ R^H:编码跨度宽度(长度)的学习嵌入。嵌入表大小为 33 × H。
- • h_{i-1}, h_{j+1} ∈ R^H:紧邻左侧和右侧上下文 token 的上下文化嵌入(边界处补零)。
RoBERTa-large 的隐藏大小为 H=1024,拼接后的表示维度为 6H=6144。跨度向量通过一个两层 MLP,为五个阴谋角色生成 logits:
6H → Linear → H → ReLU → Dropout(0.1) → Linear → 5
#### 3.1.2 训练
##### 损失函数。
我们使用带 logits 的二元交叉熵(BCE)作为多标签预测的损失函数训练跨度分类器。为了解决严重的类别不平衡(大多数候选跨度是负例),我们对每个角色应用正例权重:
pos_weight_r = N_neg,r / N_pos,r
其中 N_neg,r 和 N_pos,r 分别是角色 r 的负例和正例跨度计数,通过前 200 个训练批次计算得到,以近似类别频率而无需完整遍历训练集。为稳定性起见,我们将权重限制在 20.0。
##### 标注策略。
为了强制精确边界学习,一个候选跨度只有在其与黄金标注跨度的交并比(IoU)≥ 0.95 时,才被标注为该角色的正例。这一高重叠标准鼓励学习精确的跨度边界,而非近似匹配。
##### 采样。
枚举所有跨度会产生数量庞大的负例。因此,我们采用三级采样策略来构建每个训练批次(每个文档最多 160 个跨度):
1. 正例:所有与黄金标注对齐的跨度。
2. 难负例:与黄金跨度部分重叠(IoU ∈ [0.50, 0.75))的跨度。
3. 随机负例:额外均匀采样的非重叠跨度。
难负例引入了边界附近的混淆情况,有助于提高跨度边界判别能力。
#### 3.1.3 解码
跨度预测通过三步后处理转换为最终标记:
1. 阈值化:我们对 sigmoid 分数应用每个角色的概率阈值。对于提交的运行,阈值通过在验证集上进行按角色的网格搜索确定,以最大化基于**词级** IoU ≥ 0.5(与官方评估一致)的宏 F1。
2. 基于包含关系的 NMS:使用非极大值抑制(NMS)修剪重叠的跨度。如果低分跨度 B 与高分跨度 A 的包含比 |A∩B| / min(|A|,|B|) 超过 contain_thr,或者 IoU(A,B) ≥ iou_thr,则低分跨度 B 会被抑制。这移除了冗余的嵌套或高度重叠的预测。我们使用在验证集上调优的角色特定阈值(contain_thr 0.65–0.75,iou_thr 0.35–0.45),对于低召回角色(行为、影响、证据)采用更宽松的值以提高召回率。
3. 跨度合并:在 NMS 之后,对于相同角色且字符间隙较小(≤3)的相邻跨度进行合并,形成连续的标记。
#### 3.1.4 实验细节
##### 超参数。
我们使用 AdamW 优化器微调 RoBERTa-large,学习率为 2×10^{-5},权重衰减 0.01,线性预热占训练步数的 10%,之后余弦衰减。最大序列长度为 512 个 token,最大跨度为 32 个 token。训练使用批量大小 2,最多 14 个 epoch,基于验证集解码后的微 F1(字符级 IoU ≥ 0.3)提前停止(耐心值 5)。我们使用随机种子 42。
#### 3.1.5 结果
在验证集上,我们的最佳跨度模型在阈值化和基于包含关系的 NMS 后实现了 0.6501 的解码微 F1,其中预测跨度如果与黄金跨度在字符级 IoU ≥ 0.3 上匹配,则被视为正确。每个角色的验证性能如表 1 所示。
表 1:子任务 1 验证结果(解码后的跨度;字符 IoU ≥ 0.3)。在官方测试集上,共享任务报告的是基于词级重叠的 F1(IoU ≥ 0.5)。在此评估下,我们提交的运行实现了 0.2251 的宏 F1 和 0.2408 的微 F1。
验证分数与官方分数之间的差异反映了更严格的词级 IoU 阈值以及宏 F1 对低频角色更高的敏感性。在开发过程中,验证使用 IoU ≥ 0.3 以稳定跨度边界学习,而提交的阈值则在 IoU ≥ 0.5 下调整,以匹配共享任务的评估指标。
表 2:子任务 1 官方测试结果(词级 IoU ≥ 0.5)。
### 3.2 子任务 2:阴谋检测
#### 3.2.1 架构
我们将子任务 2 建模为文档级序列分类。每个输入文档通过 RoBERTa-large 编码,使用 [CLS] token 的上下文表示作为固定长度的文档嵌入。
该表示通过一个分类头,该分类头包含一个带 Tanh 激活函数和 dropout 的线性投影,随后是一个最终线性层,为三个标签(是、否、无法判断)生成 logits。RoBERTa 编码器和分类头联合微调。
#### 3.2.2 训练
##### 损失函数。
我们使用交叉熵损失训练文档分类器,针对三个标签(是、否、无法判断)。为了减少过度自信并在类别不平衡下提升泛化能力,我们应用标签平滑,参数 α=0.05。
##### 数据划分。
我们使用分层 90/10 的训练-验证集划分,以保持类分布。
##### 优化。
使用 AdamW 优化器微调模型,采用带预热的线性学习率调度。训练最多进行 8 个 epoch,基于验证集加权 F1 提前停止(耐心值 3)。
#### 3.2.3 实验细节
##### 超参数。
我们使用 AdamW 优化器微调 RoBERTa-large,学习率为 2×10^{-5},权重衰减 0.01,线性预热占训练步数的 10%。最大序列长度为 512 个 token,标签平滑为 0.05。训练使用批量大小 4,最多 8 个 epoch,提前停止(耐心值 3)。
#### 3.2.4 结果
在验证集划分上,我们的最佳分类器实现了加权 F1 0.6739 和准确率 0.6744。在官方测试集上,我们提交的运行实现了加权 F1 0.7694 和准确率 0.相似文章
基于Transformer模型的多语言极化检测:类别加权与阈值调优
本文介绍了用于SemEval-2026任务9(多语言极化检测)的系统,使用RoBERTa处理英语、AfroXLMR处理斯瓦希里语,采用类别加权损失和阈值调优,在二元和多标签子任务上取得了有竞争力的F1分数。
超越文档基础:代码、工具输出和文档上的跨度级幻觉检测
本文介绍了一个统一的基准,用于RAG系统中的跨度级幻觉检测,该基准超越了自然语言,扩展到代码、工具输出和结构化文档,并展示了一个微调的Qwen3.5-2B检测器,该检测器在这些新领域上优于现有方法,同时在标准NLP基准上保持竞争力。
psytechlab 在 CLPsych 2026:利用自然语言处理方法和大型语言模型进行社交媒体文本分析
本文描述了在 CLPsych 2026 共享任务中,使用包括 LSTM、BERT 和 LLMs 在内的自然语言处理方法分析社交媒体帖子中的心理健康状态,并在摘要任务中取得了最高的一致性得分。
YEZE 参加 SemEval-2026 任务 9:通过异构集成检测多语言、多文化和多事件的网络极化
本文介绍了用于 SemEval-2026 任务 9 的 YEZE 系统,该系统利用 XLM-RoBERTa 和 mDeBERTa 模型的异构集成,检测 22 种语言中的网络极化现象。
SwanNLP在SemEval-2026任务5中的工作:用于叙述词义消歧中合理性评分的LLM框架
SwanNLP在SemEval-2026任务5中提出了一个基于LLM的合理性评分框架,用于叙述词义消歧任务。该框架采用结构化推理和动态少样本提示技术,预测短篇故事中词义的人类感知合理性。研究表明,通过少样本提示和模型集成,商用大参数语言模型能够有效复现真实叙述场景中的人类判断模式。