ToxiREX:上下文中有毒推理的数据集
摘要
ToxiREX 是一个新的多语言 Reddit 评论数据集,采用有毒推理模式对隐性毒性进行标注,涵盖六种语言和多个事件。
arXiv:2606.27981v1 公告类型:新
摘要:我们引入了一个新的、上下文相关的多语言数据集 ToxiREX:上下文中有毒推理。该数据集由 Reddit 评论的线程以及对评论隐含内容的结构化描述组成,遵循先前论文中开发的系统性有毒推理模式。利用该模式,我们能够捕捉并解释隐性和依赖于上下文的毒性,同时支持映射到现有的毒性分类体系。数据集包含六种语言(英语、阿拉伯语、土耳其语、西班牙语、德语和荷兰语)的评论,这些评论收集自与特定重大事件相关的帖子(例如 2023 年土耳其地震;俄罗斯入侵乌克兰)。我们描述了保留上下文的线程预处理过程。我们创建了一个训练集,包含 12.5 万条评论,由商用大语言模型进行标注;以及一个测试集,包含近三千条评论,由母语者进行标注。我们展示了测试集标注中表面上的分歧往往反映的是合理的替代解释,而非噪声。最后,我们通过提示和微调语言模型提供了基线结果。为了得到这些结果,我们针对基于模式的层次化预测开发了评估策略。虽然模型表现优于随机,但仍有很大的改进空间,表明该任务具有挑战性。ToxiREX 是首个同时整合多种语言、对话上下文和隐性毒性,并使用有毒推理模式进行丰富结构化标注的数据集。数据集获取地址:https://github.com/cltl/toxirex
查看缓存全文
缓存时间: 2026/06/29 05:25
# ToxiREX:一个关于上下文毒性推理的数据集 来源:https://arxiv.org/abs/2606.27981 查看PDF (https://arxiv.org/pdf/2606.27981) > 摘要:我们引入了一个全新的、情境化的多语言数据集——ToxiREX:上下文毒性推理(Toxic REasoning in ConteXt)。该数据集包含Reddit评论的线程,以及基于先前论文中开发的系统性毒性推理模式对评论隐含含义的结构化表征。利用该模式,我们能够捕捉并解释隐式且依赖上下文的毒性,同时支持映射到现有的毒性分类体系。数据集涵盖六种语言(英语、阿拉伯语、土耳其语、西班牙语、德语和荷兰语)的评论,这些评论收集自与特定重大事件(例如2023年土耳其地震;俄罗斯入侵乌克兰)相关的帖子。我们描述了保留上下文的线程预处理流程。我们创建了一个包含12.5万条评论的训练集(由商业可用的大语言模型标注),以及一个接近3000条评论的测试集(由母语者标注)。我们发现测试集标注中明显的分歧往往反映了合理的替代解释,而非噪声。最后,我们通过提示和微调语言模型提供了基线结果。为得到这些结果,我们针对层次化、基于模式的预测制定了评估策略。虽然模型的表现优于随机,但仍有很大的改进空间,表明该任务具有挑战性。ToxiREX是首个同时整合多语言、对话上下文和隐式毒性,并使用毒性推理模式进行丰富结构化标注的数据集。数据集地址:this https URL (https://github.com/cltl/toxirex) ## 提交历史 来自:Stefan Schouten MSc \[查看邮箱 (https://arxiv.org/show-email/72f07455/2606.27981)\] **\[v1\]**2026年6月26日星期五 11:30:42 UTC (952 KB)
相似文章
面向Reddit生物伦理争议中立场检测的上下文感知数据集
介绍了BioStance,这是一个包含39,600个已标注的Reddit帖子和评论对的上下文感知数据集,用于生物伦理争议中的立场检测,涵盖生物伦理辩论三个维度的六个目标。
从Reddit平台中筛选与提取药物相关实体
介绍了ReDose数据集,该数据集包含6,435条Reddit帖子,标注了药物、剂量和效果实体,并评估了包括BiomedBERT、Llama-3 70B和GPT-4在内的多种模型的提取性能。
新词,新毒性:基于共识的中文新词毒性检测——通过搜索增强的大语言模型
本文提出了SeTox,一种搜索增强的大语言模型框架,通过利用实时网络上下文和公众共识来检测中文新词中的隐性毒性。实验表明,即使是3B规模的模型,在此任务上也优于近期更大的模型。
在辩论中辨别是非:中文有害迷因的归因分析
本文介绍了Ex-ToxiCN-MM——首个中文有害迷因解释数据集,以及知识库C-HarmKB和归因分析框架RIKE,通过考虑文化背景和语义模糊性,提升有害迷因的可解释检测能力。
ShriNep@EEUCA 2026: RAKSHAK——基于理由蒸馏与Jigsaw增强训练的多任务DeBERTa毒性意图分类系统
本文提出了RAKSHAK,一种结合了理由蒸馏和Jigsaw增强训练的多任务DeBERTa-v3框架,用于对《坦克世界》聊天话语中的毒性意图进行分类,在EEUCA 2026的GameTox共享任务中获得第七名。