大语言模型中欺骗探测探头的压力测试:可伸缩性、鲁棒性与欺骗表征的几何特性

Hugging Face Daily Papers 论文

摘要

本文系统测试了用于大语言模型欺骗检测的线性探头,发现它们在分布偏移下失效,但风格增强型探头能恢复性能,并揭示欺骗是通过分布式亚阈值特征编码的。

针对大语言模型激活值训练的线性探头越来越多地被提出作为欺骗检测指标,但在干净基准测试上报告AUROC超过0.96的同时,它们在分布偏移下会崩溃。本文对Gemma 3模型系列(1B-27B参数)中的探头度量进行了系统性压力测试,诊断其失败原因,而非仅仅记录失败现象。我们测试了关于欺骗编码的四个假设:(1)单一线性方向,(2)多维系空间,(3)凸锥包,(4)熵代理。实验设计包括跨域转移矩阵、基于置换零基线的多维探头分析、熵残差化测试以及涵盖8种风格偏移的干扰项评估。我们发现:(a)探头在干净数据上达到近乎完美的AUROC(>=0.998),但在风格偏移下崩溃;风格增强型探头在未见风格上恢复近乎完美的检测(平均AUROC 0.979-0.983);(b)单一方向假设被拒绝(k=1仅捕获0.61-0.80 AUROC),跨域转移失败被确认为几何原因而非层不匹配所致;(c)熵代理假设被拒绝(最大|rho|=0.454,残差化后最大Delta-AUROC=0.004);(d)欺骗并不构成显著的线性子空间(每域k*=0),但多维探头(k>=5)通过分布式亚阈值特征恢复信号。探头脆弱性反映的是分布狭窄性,而非架构限制:风格增强型探头在4B和27B规模均恢复近乎完美的检测,从而确立逆缩放模式是训练分布伪影,而非真正的尺度相关现象。
查看原文
查看缓存全文

缓存时间: 2026/06/03 07:36

论文页面 - 压力测试大语言模型中的欺骗探测:扩展性、鲁棒性与欺骗表征的几何结构

来源:https://huggingface.co/papers/2605.27958

摘要

尽管在干净数据上表现优异,用于大语言模型欺骗检测的线性探针在分布偏移下会失效,这表明欺骗是通过分布式亚阈值特征而非简单线性方向编码的。

在大语言模型激活(https://huggingface.co/papers?q=LLM%20activations)上训练的线性探针(https://huggingface.co/papers?q=Linear%20probes)越来越多地被用作欺骗检测指标(https://huggingface.co/papers?q=deception-detection%20metrics),尽管它们在干净基准测试上报告的AUROC(https://huggingface.co/papers?q=AUROC)超过0.96,但在分布偏移(https://huggingface.co/papers?q=distributional%20shift)下会崩溃。本文系统地压力测试了基于探针的指标在Gemma 3模型家族(https://huggingface.co/papers?q=Gemma%203%20model%20family)(1B-27B参数)上的表现,诊断它们为何失败,而不仅仅是记录失败。我们测试了关于欺骗编码的四种假设:(1)单一线性方向;(2)多维子空间;(3)凸锥包(https://huggingface.co/papers?q=convex%20conic%20hull);(4)熵代理(https://huggingface.co/papers?q=entropy%20proxy)。我们的设计包括跨域转移矩阵(https://huggingface.co/papers?q=cross-domain%20transfer)、带置换零基线的多维探针分析(https://huggingface.co/papers?q=multi-dimensional%20probe%20analysis)、熵残差化(https://huggingface.co/papers?q=entropy-residualization)测试,以及在8种风格偏移(https://huggingface.co/papers?q=stylistic%20shifts)下的干扰项评估。我们发现:(a)探针在干净数据上达到近乎完美的AUROC(https://huggingface.co/papers?q=AUROC)(>=0.998),但在风格偏移(https://huggingface.co/papers?q=stylistic%20shifts)下崩溃;风格增强探针恢复了近乎完美的检测(平均AUROC(https://huggingface.co/papers?q=AUROC)为0.979-0.983)在未见过的风格上;(b)单方向假设被拒绝(k=1仅捕获0.61-0.80的AUROC(https://huggingface.co/papers?q=AUROC)),跨域转移(https://huggingface.co/papers?q=cross-domain%20transfer)失败被确认为几何原因而非层不匹配(https://huggingface.co/papers?q=layer-mismatch)驱动;(c)熵代理假设被拒绝(最大|rho|=0.454,残差化后最大Delta-AUROC(https://huggingface.co/papers?q=AUROC)=0.004);(d)欺骗并未形成显著的线性子空间(每域k*=0),但多维探针(k>=5)通过分布式亚阈值特征恢复了信号。探针的脆弱性反映了分布上的狭窄性,而非架构上的局限性:风格增强探针在4B和27B上都恢复了近乎完美的检测,从而确定逆缩放模式是训练分布的人为产物,而非真正的规模依赖现象。

查看arXiv页面(https://arxiv.org/abs/2605.27958)查看PDF(https://arxiv.org/pdf/2605.27958)GitHub0(https://github.com/techsachinkr/llm-deception-probe-stress-test)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.27958)

在您的智能体中获取此论文:

hf papers read 2605.27958

还没有最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型链接此论文

请在模型README.md中引用arxiv.org/abs/2605.27958以从此页面链接它。

引用此论文的数据集0

没有数据集链接此论文

请在数据集README.md中引用arxiv.org/abs/2605.27958以从此页面链接它。

引用此论文的Spaces0

没有Space链接此论文

请在Space README.md中引用arxiv.org/abs/2605.27958以从此页面链接它。

包含此论文的收藏集0

没有包含此论文的收藏集

将此论文添加到收藏集(https://huggingface.co/new-collection)以从此页面链接它。

相似文章

偏好学习中测谎器监督的扩展趋势

arXiv cs.AI

本文将SOLiD测谎器监督方法扩展到更大的LLM(参数规模高达405B),并在真实的偏好学习场景中进行评估,发现未检测到的欺骗行为随模型规模增大而减少,但该方法对训练数据之间的分布偏移敏感。

"你撒谎了吗?" 跨模型规模与信念验证模型实体的谎言检测评估

arXiv cs.AI

本文评估了四种针对语言模型的谎言检测方法,覆盖了提示谎言和训练好的模型实体,发现基于激活和logprob的检测器在训练好的模型实体上性能急剧下降,而思维链评判器仍然表现强劲。本文引入了新的测试平台以及“你撒谎了吗?”(DYL)后续探针方法,并发布了数据集和模型实体。