标签
本文提出了自适应分布外检测中自我毒化的理论框架,证明了崩溃的尖锐阈值以及一种切断反馈回路的有保证的无标签校准方法。同时,提供了关于在无标签情况下区分漂移与污染的不可能性结果。
本文介绍了一种新颖的方法,利用稀疏自编码器(SAEs)从网络中间激活中学习可解释特征,用于分布外(OOD)检测,该方法达到了最先进的性能,并提供了关于分布偏移如何影响所学表示的见解。
MM++是一个完全无监督的事后分布外检测框架,通过Top-K门控特征融合融合具有判别性的中间层,并使用正则化的绑定协方差矩阵进行尺度不变距离估计。
本文扩展了经验发现:线性探针之间的马氏余弦相似度(MCS)线性预测了分布外AUROC,并在高斯假设下从理论上证明了这一关系。
讨论了在无潜在特征访问的封闭LLM API上进行分布外检测的方法,重点介绍了SelfCheckGPT、令牌级熵、代理嵌入和验证器模型等技术,并指出OOD检测与幻觉检测的合并。
TTL引入了一个测试时文本学习框架,用于使用CLIP等预训练视觉-语言模型进行OOD检测,该框架能够从未标记的测试流中动态学习OOD语义,无需外部OOD标签。该方法使用伪标记样本和OOD知识净化策略来提高检测的鲁棒性,应对多样化和不断演变的OOD分布。