ToxiREX:上下文中有毒推理的数据集

arXiv cs.CL 论文

摘要

ToxiREX 是一个新的多语言 Reddit 评论数据集,采用有毒推理模式对隐性毒性进行标注,涵盖六种语言和多个事件。

arXiv:2606.27981v1 公告类型:新 摘要:我们引入了一个新的、上下文相关的多语言数据集 ToxiREX:上下文中有毒推理。该数据集由 Reddit 评论的线程以及对评论隐含内容的结构化描述组成,遵循先前论文中开发的系统性有毒推理模式。利用该模式,我们能够捕捉并解释隐性和依赖于上下文的毒性,同时支持映射到现有的毒性分类体系。数据集包含六种语言(英语、阿拉伯语、土耳其语、西班牙语、德语和荷兰语)的评论,这些评论收集自与特定重大事件相关的帖子(例如 2023 年土耳其地震;俄罗斯入侵乌克兰)。我们描述了保留上下文的线程预处理过程。我们创建了一个训练集,包含 12.5 万条评论,由商用大语言模型进行标注;以及一个测试集,包含近三千条评论,由母语者进行标注。我们展示了测试集标注中表面上的分歧往往反映的是合理的替代解释,而非噪声。最后,我们通过提示和微调语言模型提供了基线结果。为了得到这些结果,我们针对基于模式的层次化预测开发了评估策略。虽然模型表现优于随机,但仍有很大的改进空间,表明该任务具有挑战性。ToxiREX 是首个同时整合多种语言、对话上下文和隐性毒性,并使用有毒推理模式进行丰富结构化标注的数据集。数据集获取地址:https://github.com/cltl/toxirex
查看原文
查看缓存全文

缓存时间: 2026/06/29 05:25

# ToxiREX:一个关于上下文毒性推理的数据集
来源:https://arxiv.org/abs/2606.27981
查看PDF (https://arxiv.org/pdf/2606.27981)

> 摘要:我们引入了一个全新的、情境化的多语言数据集——ToxiREX:上下文毒性推理(Toxic REasoning in ConteXt)。该数据集包含Reddit评论的线程,以及基于先前论文中开发的系统性毒性推理模式对评论隐含含义的结构化表征。利用该模式,我们能够捕捉并解释隐式且依赖上下文的毒性,同时支持映射到现有的毒性分类体系。数据集涵盖六种语言(英语、阿拉伯语、土耳其语、西班牙语、德语和荷兰语)的评论,这些评论收集自与特定重大事件(例如2023年土耳其地震;俄罗斯入侵乌克兰)相关的帖子。我们描述了保留上下文的线程预处理流程。我们创建了一个包含12.5万条评论的训练集(由商业可用的大语言模型标注),以及一个接近3000条评论的测试集(由母语者标注)。我们发现测试集标注中明显的分歧往往反映了合理的替代解释,而非噪声。最后,我们通过提示和微调语言模型提供了基线结果。为得到这些结果,我们针对层次化、基于模式的预测制定了评估策略。虽然模型的表现优于随机,但仍有很大的改进空间,表明该任务具有挑战性。ToxiREX是首个同时整合多语言、对话上下文和隐式毒性,并使用毒性推理模式进行丰富结构化标注的数据集。数据集地址:this https URL (https://github.com/cltl/toxirex)

## 提交历史

来自:Stefan Schouten MSc \[查看邮箱 (https://arxiv.org/show-email/72f07455/2606.27981)\] **\[v1\]**2026年6月26日星期五 11:30:42 UTC (952 KB)

相似文章

从Reddit平台中筛选与提取药物相关实体

arXiv cs.CL

介绍了ReDose数据集,该数据集包含6,435条Reddit帖子,标注了药物、剂量和效果实体,并评估了包括BiomedBERT、Llama-3 70B和GPT-4在内的多种模型的提取性能。