标签
本研究引入 SHAP-RTL,一个渲染层,用于校正针对右到左语言的 SHAP 和 LIME 解释可视化,解决标记序列和文本塑形等问题,同时保留原始归因值。
本文提出一个可解释的仇恨言论检测框架,整合了DistilBERT嵌入、BiLSTM和注意力机制,在基准数据集上针对二分类和多分类任务实现了高F1分数。
介绍了 ParsHate,一个手动标注的 10,000 条波斯语推文数据集,用于仇恨言论和目标检测,展示了当前模型的中等性能,并强调了需要更先进的方法。
本文对模因中仇恨言论检测的视觉-语言模型进行定性分析,评估了它们在零样本和少样本提示下的性能和推理能力。
本文提出了一种用于多语言仇恨言论检测的训练时可解释性框架,通过将模型推理与人类理据对齐,以提高分类性能和可解释性,并在英语和Hinglish数据集上进行了评估。
本文研究了通过指令微调通用大语言模型来实现健壮的有害内容缓解,特别是仇恨言论检测,使用了一个包含36个数据集的统一语料库,取得了最先进的性能,并增强了跨领域和跨语言的泛化能力。
本文评估了大语言模型在罗马乌尔都语(一种资源匮乏语言)中的仇恨言论检测能力,证明使用LoRA的参数高效微调相比零样本推理显著提升了分类性能。
本文描述了一个用于尼泊尔表情包分类的两阶段视觉-语言适配系统,使用Qwen3-VL-8B-Instruct,结合LoRA微调和对比学习。该系统在CHiPSAL 2026共享任务中,在仇恨言论检测中排名第二,在情感分析中排名第四。
Reddit已部署AI/LLM实时分析所有帖子和评论中的仇恨言论与有害内容,能在几秒内自动封禁用户,这与Instagram和Facebook形成对比,后两者并未如此严格地应用此类分析。