language-model-monitoring

标签

Cards List
#language-model-monitoring

最后一个Token之前:诊断最终Token安全探针的故障

arXiv cs.LG · 2026-05-14 缓存

本文研究了最终Token安全探针在越狱提示上的失败,发现有害内容可以分布在较早的Token中,并被最终读取忽略。它提出了一种PCA-HMM轨迹模型作为诊断工具,该模型能够恢复许多遗漏,而不会产生简单Token池化的误报。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈