toxicity-detection

标签

Cards List
#toxicity-detection

多语言语言模型中有毒内容检测与缓解策略综述

arXiv cs.CL · 2026-06-25 缓存

本综述综合了关于多语言大语言模型中有毒内容检测与去毒化研究,梳理了威胁模型、任务形式、检测方法和缓解策略,同时指出了持续存在的挑战,如语言覆盖不均衡以及危害定义的文化依赖性。

0 人收藏 0 人点赞
#toxicity-detection

论大语言模型适应性的局限:模型内化先验对标注任务性能的影响

arXiv cs.CL · 2026-06-02 缓存

本文研究了LLM的内化先验如何影响零样本标注性能,发现近三分之二的错误抵抗基于提示的修正,并引入了定义特定熟悉度(DSF)作为比记忆化指标更好的预测因子。

0 人收藏 0 人点赞
#toxicity-detection

更难防御:面向中文的通过隐式增强与混淆重写实现的毒性攻击

arXiv cs.CL · 2026-05-22 缓存

本文提出了CITA框架,用于生成中文隐式毒性攻击,以评估和改进大语言模型的毒性检测器,在测试模型上实现了较高的攻击成功率。

0 人收藏 0 人点赞
#toxicity-detection

基于稳健训练和弃权的公平且校准的毒性检测

arXiv cs.LG · 2026-05-15 缓存

本文研究了毒性分类中的公平性问题,涵盖三个维度:排序、校准和弃权。比较了经验风险最小化(ERM)、加权ERM和群体分布鲁棒优化(Group DRO)方法,并结合后处理干预措施,发现校准差异是一种隐蔽的公平性违反,且弃权本身也可能不公平。

0 人收藏 0 人点赞
#toxicity-detection

PSK@EEUCA 2026:利用合成数据增强微调大型语言模型以检测游戏聊天中的多类毒性

arXiv cs.CL · 2026-05-11 缓存

本文介绍了一个用于 EEUCA 2026 游戏聊天毒性检测共享任务的系统,该系统通过结合合成数据增强微调 Llama 3.1 8B 模型,获得了第四名。文章重点阐述了一种“验证陷阱”现象:由于数据分布偏移,较高的验证分数与测试集表现并不相关。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈