如何在无潜在特征访问的封闭LLM API上进行OOD检测?
摘要
讨论了在无潜在特征访问的封闭LLM API上进行分布外检测的方法,重点介绍了SelfCheckGPT、令牌级熵、代理嵌入和验证器模型等技术,并指出OOD检测与幻觉检测的合并。
经典的OOD检测假设你可以看到模型内部。特征上的马氏距离和基于logits的能量是典型方法,两者都需要对模型进行内部访问。对于封闭的LLM API,你只能输入文本、输出文本,如果幸运的话,还能获取每个令牌的前K个对数概率。在这种约束下可行的方案包括:基于采样一致性的SelfCheckGPT、利用API暴露的对数概率计算令牌级熵、使用你自己的编码器生成代理嵌入,或者对输出使用独立的验证器模型。困扰我的是,在这种设置下,经典的OOD检测和幻觉检测合并为了同一问题,因为两者都表现为模型生成不可靠的文本。如果你目前在生产环境中使用封闭LLM,你实际的OOD信号是什么?以及你如何决定何时信任输出?
相似文章
从令牌到语义:利用互补信号在黑盒LLMs中检测幻觉
本文提出通过结合语义熵和令牌级不确定性信号来检测黑盒LLMs中的幻觉的方法,评估了TopK、CoCoA、Gated和Stacked等技术在多个基准测试中的表现,发现没有单一方法普遍最强,但Stacked通常表现最佳。
基于开权重代理分析器激活的幻觉检测
本文介绍了一种代理分析器框架,通过分析小型开权重模型的内部激活状态而非生成模型本身,来检测大型语言模型中的幻觉。与 ReDeEP 等现有方法相比,该方法在 RAGTruth 等基准测试中表现出更优越的性能,证明了分析方法的优劣比模型大小更为关键。
LLMs中的幻觉:基于生命周期的成因、检测、缓解与预防综述
这篇综述论文提出了一种基于生命周期的框架,用于理解LLMs中的幻觉现象,涵盖数据、训练和推理阶段的成因、检测、缓解与预防。
OpenHalDet:一种针对多样生成场景下幻觉检测的统一基准
OpenHalDet 是一个用于大语言模型幻觉检测的统一基准,它标准化了跨不同生成场景的评估,并支持黑盒、灰盒和白盒检测方法。
PLSP(Pre-hoc Liminal Space Profiling):OOD预测取代检测——一种面向机器学习模型可靠性的预测方法
本文介绍了PLSP这一用于分布外预测的先验框架,利用可信度度量来增强机器学习模型的可靠性。