hate-speech-detection

标签

Cards List
#hate-speech-detection

当解释无法阅读时:测量和校正面向右到左语言的 SHAP 与 LIME 渲染

arXiv cs.LG ↗ · 昨天 缓存

本研究引入 SHAP-RTL,一个渲染层,用于校正针对右到左语言的 SHAP 和 LIME 解释可视化,解决标记序列和文本塑形等问题,同时保留原始归因值。

0 人收藏 0 人点赞
#hate-speech-detection

一种可解释的DistilBERT-BiLSTM-Attention框架用于二分类和多分类仇恨言论检测

arXiv cs.CL ↗ · 昨天 缓存

本文提出一个可解释的仇恨言论检测框架,整合了DistilBERT嵌入、BiLSTM和注意力机制,在基准数据集上针对二分类和多分类任务实现了高F1分数。

0 人收藏 0 人点赞
#hate-speech-detection

ParsHate: 波斯语仇恨与目标检测基准数据集

arXiv cs.CL ↗ · 2026-09-16 缓存

介绍了 ParsHate,一个手动标注的 10,000 条波斯语推文数据集,用于仇恨言论和目标检测,展示了当前模型的中等性能,并强调了需要更先进的方法。

0 人收藏 0 人点赞
#hate-speech-detection

超越准确性:模因中仇恨言论检测的视觉-语言模型定性分析

arXiv cs.CL ↗ · 2026-08-28 缓存

本文对模因中仇恨言论检测的视觉-语言模型进行定性分析,评估了它们在零样本和少样本提示下的性能和推理能力。

0 人收藏 0 人点赞
#hate-speech-detection

多语言仇恨言论检测的训练时可解释性:对齐模型推理与人类理据

arXiv cs.CL ↗ · 2026-08-28 缓存

本文提出了一种用于多语言仇恨言论检测的训练时可解释性框架,通过将模型推理与人类理据对齐,以提高分类性能和可解释性,并在英语和Hinglish数据集上进行了评估。

0 人收藏 0 人点赞
#hate-speech-detection

从专业化到通用化:指令微调大语言模型用于健壮有害内容缓解

arXiv cs.CL ↗ · 2026-08-27 缓存

本文研究了通过指令微调通用大语言模型来实现健壮的有害内容缓解,特别是仇恨言论检测,使用了一个包含36个数据集的统一语料库,取得了最先进的性能,并增强了跨领域和跨语言的泛化能力。

0 人收藏 0 人点赞
#hate-speech-detection

针对资源匮乏语言仇恨言论检测的LLM高效适应:罗马乌尔都语的比较研究

arXiv cs.AI ↗ · 2026-08-20 缓存

本文评估了大语言模型在罗马乌尔都语(一种资源匮乏语言)中的仇恨言论检测能力,证明使用LoRA的参数高效微调相比零样本推理显著提升了分类性能。

0 人收藏 0 人点赞
#hate-speech-detection

ZeroR@CHiPSAL 2026:基于对比学习的两阶段视觉-语言适配用于尼泊尔表情包分类

arXiv cs.CL ↗ · 2026-08-03 缓存

本文描述了一个用于尼泊尔表情包分类的两阶段视觉-语言适配系统,使用Qwen3-VL-8B-Instruct,结合LoRA微调和对比学习。该系统在CHiPSAL 2026共享任务中,在仇恨言论检测中排名第二,在情感分析中排名第四。

0 人收藏 0 人点赞
#hate-speech-detection

AI在现实世界中的部署

Reddit r/ArtificialInteligence ↗ · 2026-06-08

Reddit已部署AI/LLM实时分析所有帖子和评论中的仇恨言论与有害内容,能在几秒内自动封禁用户,这与Instagram和Facebook形成对比,后两者并未如此严格地应用此类分析。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈