feedback-robustness

标签

Cards List
#feedback-robustness

漂白仇恨、抹黑无害内容:针对基于LLM的内容审核的注释者风格反驳攻击

arXiv cs.CL · 20小时前 缓存

本文研究了基于LLM的仇恨言论审核对注释者风格反驳的敏感性,表明此类攻击会降低性能,并揭示了漂白和抹黑操作之间的方向性不对称。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈