面向Reddit生物伦理争议中立场检测的上下文感知数据集
摘要
介绍了BioStance,这是一个包含39,600个已标注的Reddit帖子和评论对的上下文感知数据集,用于生物伦理争议中的立场检测,涵盖生物伦理辩论三个维度的六个目标。
arXiv:2606.13187v1 公告类型:新
摘要:生物伦理辩论日益在社交媒体上展开,然而立场检测研究缺乏大规模、领域特定的资源来建模这种依赖于上下文的讨论。我们提出了BioStance,这是一个包含39,600个已标注的Reddit生物伦理讨论中帖子和评论对的上下文感知数据集。BioStance覆盖了生物伦理争议三个维度的六个争议性目标:基本价值冲突、个人自由与集体责任、以及技术不确定性。每个实例保留了层次化的对话上下文,并由三名独立标注者使用三类立场方案(支持、反对和无立场)进行标注。标注结果的平均Krippendorff's $\alpha$ 达到0.82,表明可靠性较高。通过结合主题多样性、对话结构和高品质的人工标注,BioStance支持上下文感知立场检测、论证挖掘以及生物伦理话语计算分析的研究。
查看缓存全文
缓存时间: 2026/06/12 08:51
# 一个面向Reddit生物伦理争议立场检测的上下文感知数据集 来源:https://arxiv.org/html/2606.13187 Genan Dai2Fuqiang Niu1Yi Yang2Zhaoya Gong3Bowen Zhang2 1中国科学技术大学网络空间安全学院,合肥,中国 2深圳技术大学人工智能学院,深圳,中国 3北京大学城市规划与设计学院,深圳,中国 ###### 摘要 生物伦理辩论越来越多地在社交媒体上展开,然而立场检测研究缺乏大规模、领域特定的资源来对这种依赖上下文的论述进行建模。我们提出了BioStance,一个包含来自Reddit生物伦理讨论的39,600个已标注“帖子-评论”对的上下文感知数据集。BioStance覆盖了六个有争议的目标,涉及生物伦理争议的三个维度:基本价值冲突、个人自由与集体责任,以及技术不确定性。每个实例均保留了分层的对话上下文,并由三名独立标注员使用三类立场方案(支持、反对、无立场)进行标注。标注结果的Krippendorff's α均值达到0.82,表明具有较高的可靠性。通过结合主题多样性、对话结构以及高质量的人工标注,BioStance支持上下文感知立场检测、论点挖掘以及生物伦理论述的计算分析研究。 一个面向Reddit生物伦理争议立场检测的上下文感知数据集 ## 1 引言 生物技术的快速发展重塑了公共话语,将生物伦理辩论从学术领域转移到社交媒体平台,如Reddit^1^(Scheufele and Krause 2019(https://arxiv.org/html/2606.13187#bib.bib2);Proferes et al. 2021(https://arxiv.org/html/2606.13187#bib.bib4))。这些线上讨论为了解公众如何协商道德价值观、科学不确定性以及社会争议性的生物医学问题提供了宝贵的证据。此类分析对于计算社会科学以及发展价值对齐的人工智能具有重要意义(Weidinger et al. 2022(https://arxiv.org/html/2606.13187#bib.bib5);Bender et al. 2021(https://arxiv.org/html/2606.13187#bib.bib14))。然而,现有的立场检测和论点挖掘数据集往往局限于狭义的政治话题或特定事件的辩论,如选举和新冠疫情(Mohammad et al. 2016(https://arxiv.org/html/2606.13187#bib.bib9);Glandt et al. 2021(https://arxiv.org/html/2606.13187#bib.bib16);Zhang et al. 2025(https://arxiv.org/html/2606.13187#bib.bib39)),因此未能充分覆盖生物医学伦理的更广阔领域(Cabrio and Villata 2018(https://arxiv.org/html/2606.13187#bib.bib8))。此外,许多现有语料库基于短文本且缺乏上下文,例如微博,这使得难以对解释复杂道德推理所需的对话上下文进行建模(Habernal and Gurevych 2017(https://arxiv.org/html/2606.13187#bib.bib19);Niu et al. 2024a(https://arxiv.org/html/2606.13187#bib.bib40))。在生物伦理话语的立场检测方面,仍然缺乏大规模、领域特定且上下文感知的数据集。最近模型层面的进展,例如用于社交媒体立场检测的逻辑增强多决策融合方法,进一步凸显了对能够暴露上下文和目标特定推理挑战的数据集的需求(Zhang et al., 2025(https://arxiv.org/html/2606.13187#bib.bib39))。 为了填补这一空白,我们提出了BioStance(生物伦理立场检测数据集),这是一个用于生物伦理讨论中立场检测和论点分析的大规模上下文感知数据集。BioStance包含从Reddit收集的39,600个已标注的“帖子-评论”实例,其中每条评论都与其原始源帖子配对,以保留表达立场时的话语语境。 BioStance涵盖了六个有争议的生物伦理目标,这些目标被组织在公共辩论的三个理论维度中。第一个维度是基本价值冲突,包括“堕胎”和“安乐死”,涉及关于个人权利、道德地位和道义推理的持久争议(Gillon 2003(https://arxiv.org/html/2606.13187#bib.bib12))。第二个维度是个人自由与集体责任,包括“强制疫苗接种”和“器官移植”,讨论焦点在于个人自主权、公共福利、社会责任以及共享医疗资源的分配(Kass 2001(https://arxiv.org/html/2606.13187#bib.bib11))。第三个维度是技术不确定性与风险,包括“基因编辑”和“人体临床试验”,捕捉公众关于科学信任、实验风险以及新兴生物医学技术不确定后果的推理(Ormond et al. 2017(https://arxiv.org/html/2606.13187#bib.bib17);London and Kimmelman 2020(https://arxiv.org/html/2606.13187#bib.bib18))。 BioStance的一个关键特征是保留了分层的“帖子-评论”结构。通过保留源帖子和用户回复,该数据集为建模可能隐含、模糊或依赖于先前话语的立场表达提供了语义和语用上下文(Habernal and Gurevych 2017(https://arxiv.org/html/2606.13187#bib.bib19);Zhang et al. 2024(https://arxiv.org/html/2606.13187#bib.bib38))。为确保标注质量,每个实例由三名合格的标注员使用三类方案独立标注,数据集的平均Krippendorff's α高于0.80(Hayes and Krippendorff 2007(https://arxiv.org/html/2606.13187#bib.bib13))。 总之,BioStance贡献了:(1)跨越既有伦理辩论、政策驱动的公共生物伦理问题以及新兴生物技术争议的主题多样性;(2)通过保留的帖子-评论对和分层对话结构提供上下文的深度;(3)用于训练和评估上下文感知立场检测系统的高质量人工标注。因此,BioStance支持计算社会科学、论点挖掘、生物医学伦理以及面向生物伦理的自然语言处理等领域的研究。 ## 2 方法 ### 数据收集 我们从Reddit讨论中构建了BioStance,其线程式结构使其适合对生物伦理争议辩论中依赖上下文的立场表达进行建模(Proferes et al. 2021(https://arxiv.org/html/2606.13187#bib.bib4))。该数据集聚焦于六个生物伦理目标:“堕胎”(Bearak et al. 2020(https://arxiv.org/html/2606.13187#bib.bib26))、“安乐死”(Emanuel et al. 2016(https://arxiv.org/html/2606.13187#bib.bib28))、“基因编辑”(Baltimore et al. 2015(https://arxiv.org/html/2606.13187#bib.bib30))、“人体临床试验”(Emanuel et al. 2000(https://arxiv.org/html/2606.13187#bib.bib34))、“强制疫苗接种”(Omer et al. 2019(https://arxiv.org/html/2606.13187#bib.bib27))以及“器官移植”(Persad et al. 2009(https://arxiv.org/html/2606.13187#bib.bib31))。选择这些目标是为了涵盖当代生物伦理话语中不同伦理、法律和科学维度。 我们通过官方API收集了Reddit帖子和评论,时间段为2009年2月4日至2025年5月26日。针对每个目标,我们设计了目标特定的查询词汇表,并迭代优化以平衡主题覆盖率和检索精度。完整的查询词汇表见附录C(https://arxiv.org/html/2606.13187#A3),表5(https://arxiv.org/html/2606.13187#A3.T5)。初始爬取过程产生了约958,760个候选线程。我们将“帖子-评论”对视为BioStance的基本单元,其中源帖子提供上下文,评论则是承载立场的回应。关于数据源、子版块选择以及构建流程的更多细节见附录A(https://arxiv.org/html/2606.13187#A1)。 ### 预处理 原始的Reddit数据包含已删除内容、无关讨论、重复帖子以及非标准格式。因此,我们应用了多阶段预处理流程,包括文本清洗、匿名化、相关性过滤、去重以及结构格式化。标记为“\[deleted\]”或“\[removed\]”的帖子和评论被丢弃,用户识别信息被移除以保护隐私。我们还过滤了极短的评论,以确保有足够的语义内容用于立场分析(Niu et al. 2024b(https://arxiv.org/html/2606.13187#bib.bib41))。 由于基于关键词的检索可能引入误报,我们使用GPT-3.5作为辅助二元相关性过滤器,以判断每个候选帖子是否与其预期的生物伦理目标实质性相关(Gilardi et al. 2023(https://arxiv.org/html/2606.13187#bib.bib50))。该模型仅用于主题相关性过滤,并未参与立场标注、标注指导或最终标签决策。经过预处理、相关性过滤和去重后,我们获得了用于标注的最终数据集。汇总统计见表1(https://arxiv.org/html/2606.13187#S2.T1);详细的预处理规则见附录B(https://arxiv.org/html/2606.13187#A2)。 表1:预处理后的BioStance统计信息。样本数量来自最终标注集,Avg. WC表示每个样本的平均词数。 ### 数据标注 借鉴先前立场检测的研究(Mohammad et al. 2016(https://arxiv.org/html/2606.13187#bib.bib9)),我们采用了三类标注方案:支持、反对和无立场。每个“帖子-评论”实例由三名合格的标注员独立标注,最终金标准标签通过多数投票确定(Dawid and Skene 1979(https://arxiv.org/html/2606.13187#bib.bib44))。为评估标注质量,我们在标注完成后计算了标注员间一致性(Artstein and Poesio 2008(https://arxiv.org/html/2606.13187#bib.bib53))。详细的可靠性结果在“技术验证”部分报告。数据集文件组织、字段定义及模式级细节见附录D(https://arxiv.org/html/2606.13187#A4)。 ## 3 技术验证 本节提供BioStance数据集的技術验证,重点关注标注可靠性、标签分布、对话结构以及主题覆盖。此处呈现的分析旨在评估数据集的内在一致性、结构完整性以及合理性,而非任务性能。 ### 标注可靠性 为了评估立场标注的可靠性,我们使用Krippendorff's α(Hayes and Krippendorff 2007(https://arxiv.org/html/2606.13187#bib.bib13))和总体一致性率来测量标注员间一致性。如方法部分所述,每个帖子-评论实例由三名标注员独立标注。 如表2(https://arxiv.org/html/2606.13187#S3.T2)所总结,数据集在所有六个生物伦理目标上均表现出较高的一致性。Krippendorff's α值范围从0.74到0.96,平均α值为0.82。总体一致性率范围从86.71%到95.15%,平均一致性为91.33%。这些数值表明,对于立场检测这类主观任务,标注员之间具有较高的一致性(Artstein and Poesio 2008(https://arxiv.org/html/2606.13187#bib.bib53))。 根植于科学或程序性背景的目标,例如人体临床试验和基因编辑,表现出特别高的一致性,表明涉及技术或制度考量的讨论中立场表达更为清晰。涉及基本道德冲突的主题,如堕胎和安乐死,则显示出略低但仍较高的一致性,这与这些辩论固有的主观性一致(Walker et al. 2012(https://arxiv.org/html/2606.13187#bib.bib62))。 为进一步理解标注不一致的来源,我们对低一致性实例进行了定性分析。不一致主要源于隐晦的立场表达,包括反讽、讽刺以及修辞夸张,在这些情况下,立场通过语气或上下文线索间接传达,而非通过明确的评价性语言(Somasundaran and Wiebe 2010(https://arxiv.org/html/2606.13187#bib.bib15))。额外的模糊性来自对目标的间接引用、多轮对话中的话题转移、弱极性表达(例如“也许”、“应该”)的使用以及非正式俚语。这些具有挑战性的案例被保留下来,以反映现实世界生物伦理话语的复杂性。 表2:各目标的标注一致性(Krippendorff’s α)和一致性率 ### 数据集规模与标签分布 最终的BioStance数据集包含39,600个跨六个生物伦理目标的已标注实例。与现有的立场检测基准相比(Mohammad et al. 2016(https://arxiv.org/html/2606.13187#bib.bib9)),这一规模相当可观,并支持跨不同生物伦理领域的稳健实证分析。 表3(https://arxiv.org/html/2606.13187#S3.T3)呈现了每个目标的立场标签分布(支持、反对、无立场)。数据集呈现出自然的类别不平衡,反映了真实世界讨论中观察到的模式,而非数据构建过程中引入的人工产物(Küçük and Can 2021(https://arxiv.org/html/2606.13187#bib.bib29))。例如,关于人体临床试验的讨论以支持为主(62.5%为支持),而强制疫苗接种则引发了相对较高的反对(41.7%为反对)。其他目标,如器官移植,则显示出较高比例的中性或描述性立场。 值得注意的是,没有一个目标被单一立场类别主导,所有三个标签在所有主题中均有体现。这一分布表明,数据集捕捉了多样化的观点,同时避免了可能损害其立场检测研究可用性的极端偏斜。 表3:BioStance的标签分布 ### 对话结构与深度 与扁平化的句子级数据集不同,BioStance保留了Reddit讨论的分层结构。每个实例都关联一个对话深度,指示其在讨论树中的位置,从而能够分析即时反应和扩展交流中的立场表达。 表4(https://arxiv.org/html/2606.13187#S3.T4)总结了按对话深度划分的实例分布。顶层帖子(深度1)占数据集的5.5%,而大多数实例(94.5%)是评论。直接回复(深度2)占数据的61.0%,相当一部分实例(约33%)出现在更深层次(深度3及以上)。这一分布证实了数据集既包含浅层也包含深度嵌套的交互。 平均词数在不同深度级别上保持相对稳定,表明结构一致性,并且在预处理过程中没有出现截断或格式伪影。深层对话上下文的存在支持了依赖于话语级别信息的上下文感知立场检测模型的开发和评估(Sun et al. 2018(https://arxiv.org/html/2606.13187#bib.bib55))。 表4:按对话深度划分的BioStance数据集统计信息。Avg. WC表示每个样本的平均词数,基于预处理后的文本字段计算。 ### 主题覆盖与合理性检查 为评估主题覆盖并确保不存在系统性的重
相似文章
ToxiREX:上下文中有毒推理的数据集
ToxiREX 是一个新的多语言 Reddit 评论数据集,采用有毒推理模式对隐性毒性进行标注,涵盖六种语言和多个事件。
BioDivergence:面向生物医学摘要中隐藏上下文矛盾的基准与评估框架
介绍BioDivergence,一个用于检测生物医学摘要中上下文条件矛盾的基准与评估框架,包含六类冲突分类法和一个由11,865个声明对构成的银标准数据集。
LLM辅助的科学话语立场检测:以贝叶斯认知科学为案例研究
本文提出了一种利用LLM进行科学话语立场检测的方法,具体用于识别贝叶斯认知科学文章中现实主义与工具主义的对立立场。该方法结合了理论驱动编码、专家标注和提示优化,实现了高可靠性。
从Reddit平台中筛选与提取药物相关实体
介绍了ReDose数据集,该数据集包含6,435条Reddit帖子,标注了药物、剂量和效果实体,并评估了包括BiomedBERT、Llama-3 70B和GPT-4在内的多种模型的提取性能。
Reddit上在线性暴力叙事中的污名与支持
这篇学术论文介绍了SCOPEdataset,将在线性暴力幸存者叙事中的污名信号与Reddit评论中的支持类型联系起来,发现内在化污名最为普遍,且社区回应在不同污名类型间保持稳定。