input-moderation

标签

Cards List
#input-moderation

有害性传播动态:大型语言模型中对抗意图的逐层轨迹

arXiv cs.CL · 4天前 缓存

该论文在大型语言模型中识别出有害性传播动态,并介绍了 Herald,一个轻量级的输入调节器,它利用跨层激活模式高效检测有害提示。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈