implicit-toxicity

标签

Cards List
#implicit-toxicity

安全独处,危险共处:当良性图像组合时防范隐性毒性

arXiv cs.CL · 2026-07-02 缓存

本文定义了多图像隐性毒性(MIIT),即单独无害的图像组合后产生毒性,并提出了MiShield,一个通过渐进式蒸馏推理监督训练的模型来检测MIIT。实验表明,MiShield-8B优于现有的审核服务。

0 人收藏 0 人点赞
#implicit-toxicity

ToxiREX:上下文中有毒推理的数据集

arXiv cs.CL · 2026-06-29 缓存

ToxiREX 是一个新的多语言 Reddit 评论数据集,采用有毒推理模式对隐性毒性进行标注,涵盖六种语言和多个事件。

0 人收藏 0 人点赞
#implicit-toxicity

更难防御:面向中文的通过隐式增强与混淆重写实现的毒性攻击

arXiv cs.CL · 2026-05-22 缓存

本文提出了CITA框架,用于生成中文隐式毒性攻击,以评估和改进大语言模型的毒性检测器,在测试模型上实现了较高的攻击成功率。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈