标签
本文定义了多图像隐性毒性(MIIT),即单独无害的图像组合后产生毒性,并提出了MiShield,一个通过渐进式蒸馏推理监督训练的模型来检测MIIT。实验表明,MiShield-8B优于现有的审核服务。
ToxiREX 是一个新的多语言 Reddit 评论数据集,采用有毒推理模式对隐性毒性进行标注,涵盖六种语言和多个事件。
本文提出了CITA框架,用于生成中文隐式毒性攻击,以评估和改进大语言模型的毒性检测器,在测试模型上实现了较高的攻击成功率。