latent-space-probes

标签

Cards List
#latent-space-probes

所有大语言模型都知道自己何时有害吗?跨模型家族的潜在空间安全探针可重复性研究

arXiv cs.LG · 昨天 缓存

对Khatri等人提出的潜在空间安全探针进行可重复性研究,检验其跨模型家族的泛化能力以及对非确定性的敏感性。结果表明,这些探针可扩展到其他模型并获得相似的F1分数,且最终token的潜在向量在不同随机种子下保持一致。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈