大语言模型中欺骗探测探头的压力测试:可伸缩性、鲁棒性与欺骗表征的几何特性
摘要
本文系统测试了用于大语言模型欺骗检测的线性探头,发现它们在分布偏移下失效,但风格增强型探头能恢复性能,并揭示欺骗是通过分布式亚阈值特征编码的。
查看缓存全文
缓存时间: 2026/06/03 07:36
论文页面 - 压力测试大语言模型中的欺骗探测:扩展性、鲁棒性与欺骗表征的几何结构
来源:https://huggingface.co/papers/2605.27958
摘要
尽管在干净数据上表现优异,用于大语言模型欺骗检测的线性探针在分布偏移下会失效,这表明欺骗是通过分布式亚阈值特征而非简单线性方向编码的。
在大语言模型激活(https://huggingface.co/papers?q=LLM%20activations)上训练的线性探针(https://huggingface.co/papers?q=Linear%20probes)越来越多地被用作欺骗检测指标(https://huggingface.co/papers?q=deception-detection%20metrics),尽管它们在干净基准测试上报告的AUROC(https://huggingface.co/papers?q=AUROC)超过0.96,但在分布偏移(https://huggingface.co/papers?q=distributional%20shift)下会崩溃。本文系统地压力测试了基于探针的指标在Gemma 3模型家族(https://huggingface.co/papers?q=Gemma%203%20model%20family)(1B-27B参数)上的表现,诊断它们为何失败,而不仅仅是记录失败。我们测试了关于欺骗编码的四种假设:(1)单一线性方向;(2)多维子空间;(3)凸锥包(https://huggingface.co/papers?q=convex%20conic%20hull);(4)熵代理(https://huggingface.co/papers?q=entropy%20proxy)。我们的设计包括跨域转移矩阵(https://huggingface.co/papers?q=cross-domain%20transfer)、带置换零基线的多维探针分析(https://huggingface.co/papers?q=multi-dimensional%20probe%20analysis)、熵残差化(https://huggingface.co/papers?q=entropy-residualization)测试,以及在8种风格偏移(https://huggingface.co/papers?q=stylistic%20shifts)下的干扰项评估。我们发现:(a)探针在干净数据上达到近乎完美的AUROC(https://huggingface.co/papers?q=AUROC)(>=0.998),但在风格偏移(https://huggingface.co/papers?q=stylistic%20shifts)下崩溃;风格增强探针恢复了近乎完美的检测(平均AUROC(https://huggingface.co/papers?q=AUROC)为0.979-0.983)在未见过的风格上;(b)单方向假设被拒绝(k=1仅捕获0.61-0.80的AUROC(https://huggingface.co/papers?q=AUROC)),跨域转移(https://huggingface.co/papers?q=cross-domain%20transfer)失败被确认为几何原因而非层不匹配(https://huggingface.co/papers?q=layer-mismatch)驱动;(c)熵代理假设被拒绝(最大|rho|=0.454,残差化后最大Delta-AUROC(https://huggingface.co/papers?q=AUROC)=0.004);(d)欺骗并未形成显著的线性子空间(每域k*=0),但多维探针(k>=5)通过分布式亚阈值特征恢复了信号。探针的脆弱性反映了分布上的狭窄性,而非架构上的局限性:风格增强探针在4B和27B上都恢复了近乎完美的检测,从而确定逆缩放模式是训练分布的人为产物,而非真正的规模依赖现象。
查看arXiv页面(https://arxiv.org/abs/2605.27958)查看PDF(https://arxiv.org/pdf/2605.27958)GitHub0(https://github.com/techsachinkr/llm-deception-probe-stress-test)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.27958)
在您的智能体中获取此论文:
hf papers read 2605.27958
还没有最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接此论文
请在模型README.md中引用arxiv.org/abs/2605.27958以从此页面链接它。
引用此论文的数据集0
没有数据集链接此论文
请在数据集README.md中引用arxiv.org/abs/2605.27958以从此页面链接它。
引用此论文的Spaces0
没有Space链接此论文
请在Space README.md中引用arxiv.org/abs/2605.27958以从此页面链接它。
包含此论文的收藏集0
没有包含此论文的收藏集
将此论文添加到收藏集(https://huggingface.co/new-collection)以从此页面链接它。
相似文章
超越 Liars' Bench:谎言类型、深度和稀疏性对LLM欺骗检测的影响
本文系统研究了谎言类型、表示深度、探针表达能力和稀疏特征如何影响LLM中的欺骗检测,发现检测性能高度依赖于训练数据和表示选择。
当大语言模型学会持续犯错:合成欺骗线性表示的多模型研究
本文通过微调五个Transformer模型的诚实与欺骗变体,研究大语言模型中的合成不诚实行为,发现鲁棒且域不变的不诚实表示可以通过适度的监督微调迅速固化,这对基于激活的监控具有重要意义。
线性探针在语言模型隐藏状态中检测的是任务格式,而非推理模式
本文证明,基于LLM隐藏状态的线性探针检测到的是任务格式混淆因素(例如来源身份、回答长度),而非不同的推理模式。通过残差化和因果引导,表明高探针准确率源于表面特征,而非计算结构。
偏好学习中测谎器监督的扩展趋势
本文将SOLiD测谎器监督方法扩展到更大的LLM(参数规模高达405B),并在真实的偏好学习场景中进行评估,发现未检测到的欺骗行为随模型规模增大而减少,但该方法对训练数据之间的分布偏移敏感。
"你撒谎了吗?" 跨模型规模与信念验证模型实体的谎言检测评估
本文评估了四种针对语言模型的谎言检测方法,覆盖了提示谎言和训练好的模型实体,发现基于激活和logprob的检测器在训练好的模型实体上性能急剧下降,而思维链评判器仍然表现强劲。本文引入了新的测试平台以及“你撒谎了吗?”(DYL)后续探针方法,并发布了数据集和模型实体。