BitTide
首页
最新
模型
工具
新闻
产品
论文
事件
今日日报
搜索
订阅
English
登录
feedback-robustness
标签
Cards
List
#feedback-robustness
漂白仇恨、抹黑无害内容:针对基于LLM的内容审核的注释者风格反驳攻击
arXiv cs.CL
↗
· 20小时前
缓存
本文研究了基于LLM的仇恨言论审核对注释者风格反驳的敏感性,表明此类攻击会降低性能,并揭示了漂白和抹黑操作之间的方向性不对称。
0 人收藏
0 人点赞
← 返回首页
意见反馈
×
提交意见反馈
感谢您的反馈!
提交