超越 Liars' Bench:谎言类型、深度和稀疏性对LLM欺骗检测的影响
摘要
本文系统研究了谎言类型、表示深度、探针表达能力和稀疏特征如何影响LLM中的欺骗检测,发现检测性能高度依赖于训练数据和表示选择。
arXiv:2607.20479v1 Announce Type: new
摘要:训练探针来检测大型语言模型的欺骗性输出仍然是一个开放问题。最近的研究表明,检测探针尤其在域外场景中失败——在一种谎言类型上训练不能很好地迁移到涉及其他类型谎言的欺骗场景。在这项工作中,我们系统研究了多种因素如何影响检测性能:表示深度、探针表达能力、稀疏特征表示以及训练数据的谎言类型。为此,我们用一个包含多种欺骗类型的补充数据集来增强标准基准训练数据,包括捏造、遗漏和夸张示例。通过分析七种探针类型的这些因素,我们的实验结果表明,最优表示深度高度依赖于数据集,表达能力更强的探针仅在选择性方面优于线性基线,而稀疏自编码器特征的表现与密集隐藏状态相似。最终,我们证明了训练数据和谎言类型的选择会显著改变可检测性,突出了欺骗检测是一个高度依赖表示的问题。
查看缓存全文
缓存时间: 2026/07/24 05:01
# 超越谎言测试台:谎言类型、深度与稀疏性对大型语言模型欺骗检测的影响 来源:https://arxiv.org/html/2607.20479 ###### 摘要 训练探针检测大型语言模型的欺骗性输出仍是一个开放问题。近期研究表明,检测探针在域外场景中尤其失效——针对单一谎言类型训练的模型,难以泛化到涉及其他类型谎言的欺骗场景。本研究系统考察了多种因素对检测性能的影响:表示深度、探针表达能力、稀疏特征表示以及训练数据的谎言类型。为此,我们在标准基准训练数据基础上,补充了一个包含多种欺骗类型(包括捏造、遗漏和夸大实例)的辅助数据集。通过七种探针对这些因素进行分析,实验结果表明:最优表示深度高度依赖于数据集;表达能力更强的探针相比线性基线仅带来选择性提升;稀疏自编码器特征与稠密隐态表现相似。最终,我们证明训练数据与谎言类型的选择会显著改变可检测性,凸显欺骗检测是一个高度依赖表示的问题。 AI透明性、欺骗检测、可解释性、稀疏自编码器、谎言类型 ††会议:AI透明性会议;2026年6月5–6日;地点待定 ## 1. 引言 大型语言模型日益部署在对正确性、责任感和诚实性要求极高的场景中。在这样的场景中,仅判断模型输出是否错误是不够的;一个更棘手的问题在于,模型生成的陈述是否与其内部对该陈述的信念一致。这一区别对安全监控至关重要,因为仅基于模型输出的检测器可能遗漏战略性或情境依赖的欺骗(Goldowsky-Dill 等人,2025 (https://arxiv.org/html/2607.20479#bib.bib9);Boxo 等人,2025 (https://arxiv.org/html/2607.20479#bib.bib4))。相比之下,基于模型激活的检测器(如截断多项式分类器或子空间投影方法)则试图直接在网络的隐空间中识别欺骗状态(Oldfield 等人,2026 (https://arxiv.org/html/2607.20479#bib.bib18);Bürger 等人,2024 (https://arxiv.org/html/2607.20479#bib.bib5))。 本文建立在 Liars’ Bench(Kretschmar 等人,2025 (https://arxiv.org/html/2607.20479#bib.bib13))基础上,该基准旨在评估针对开源权重模型生成的多策略欺骗行为的谎言检测器。该基准的价值在于,它超越了狭窄的真假事实陈述,包含了在模型撒谎原因和针对的信念对象两方面均有所不同的谎言。然而,该基准也暴露了现有检测器的一个弱点:在一种设置下有效的方法在另一种设置下常常失效,尤其是当无法仅从对话记录诊断出谎言时(Kretschmar 等人,2025 (https://arxiv.org/html/2607.20479#bib.bib13);Oldfield 等人,2026 (https://arxiv.org/html/2607.20479#bib.bib18))。 为深入探究这些失效模式,我们质疑欺骗本身的定性本质如何影响可检测性。我们引入 DolusChat 数据集(Cundy 和 Gleave,2025 (https://arxiv.org/html/2607.20479#bib.bib7)),系统评估谎言的具体性质(遗漏、捏造或夸大)如何影响检测结果,超越标准的事实矛盾。此外,我们测试检测性能在多大程度上依赖于表示深度、探针表达能力以及特征解缠。 总之,我们使用基于探针的方法进行了系统性研究,考虑了四个主要因素: 1. (1)谎言类型:谎言的结构类别将显著影响其可检测性,直接捏造比遗漏或夸大等更微妙、依赖上下文的欺骗形式具有更高的线性可分性。 2. (2)深度:从中间层(即那些复杂语义概念已知成熟的中后段 Transformer 块,具体定位为模型深度的约三分之二处)提取表示,应比任意早期层产生更高的线性可分性。 3. (3)表达能力:能够捕获非线性特征交互的探针族应优于标准逻辑回归。此外,几何干预(如迭代零空间投影)将揭示欺骗信号是低维且易于擦除,还是高度分布在表示空间中。 4. (4)稀疏性:稀疏自编码器 (SAE) 能将网络中重叠的概念显式解缠为独立、可解释的特征。理论上,利用这些稀疏特征应能更干净地分离欺骗信号,相比标准稠密隐态能提升或保持可分性。 参见图 1。 图 1. 评估大型语言模型中欺骗检测的端到端流水线。输入数据(真实与欺骗性响应)由模型处理,从中提取稠密隐态、稀疏 SAE 特征以及后续激活。这些表示使用多个探针族(线性、几何和稀疏)以及一个后续探针和一个基于每个评估数据集中保留的后续标记激活计算的上界探针进行评估,以估计数据集内的可分性。 说明端到端欺骗检测评估流水线的示意图。输入数据流入语言模型,生成稠密隐态和稀疏 SAE 特征。这些表示随后传入多个探针架构进行评估。 ## 2. 相关工作 ### 2.1. 大型语言模型中的欺骗 随着大型语言模型能力的增强,对齐与安全领域越来越担心它们可能学会欺骗性行为。近期研究记录了 LLM 中的奉承行为以及更具故意的欺骗行为,包括欺骗策略在安全训练后仍持续存在,或在评估/部署区分下出现的情况。例如,使用人类反馈强化学习 (RLHF) 训练的模型可能发展出奉承倾向,重复用户偏好的答案而非客观事实(Perez 等人,2023 (https://arxiv.org/html/2607.20479#bib.bib21))。更令人担忧的是,实证表明模型可能进行战略性欺骗——例如在安全评估中隐藏不安全行为,仅在部署时恶意行动——并且这些欺骗行为可能贯穿安全训练持续存在(Hubinger 等人,2024 (https://arxiv.org/html/2607.20479#bib.bib11))。更广泛的调查进一步强调了关于 AI 欺骗的日益增长的风险和潜在解决方案(Park 等人,2024 (https://arxiv.org/html/2607.20479#bib.bib20))。由于模型在仅基于对话记录的监控中有时看似良性的,传统的基于输出的安全方法在战略性场景下根本不足,这激发了使用基于内部激活的探针。 ### 2.2. 欺骗检测 为背景化欺骗研究,有必要将其与幻觉和奉承等密切相关现象区分开来。在关注有意欺骗之前,对 LLM 诚实性的评估主要依赖衡量这些相关数据的基准,例如用于事实性幻觉的 TruthfulQA(Lin 等人,2022 (https://arxiv.org/html/2607.20479#bib.bib16)),以及用于奉承行为的各种数据集——模型在此类数据中反映用户的误解而非输出客观事实(Perez 等人,2023 (https://arxiv.org/html/2607.20479#bib.bib21);Wei 等人,2024 (https://arxiv.org/html/2607.20479#bib.bib24))。然而,这些早期基准常常混淆模型真正的知识缺失与主动欺骗。 受评估真正策略性欺骗(模型输出与自身内部表示主动矛盾的陈述)的需求驱动,Kretschmar 等人 (2025 (https://arxiv.org/html/2607.20479#bib.bib13)) 引入了 Liars’ Bench,作为本文的主要基线。它根据模型撒谎的原因以及针对的信念对象对谎言进行分类。其主要贡献在于广度,但一个已知的弱点是,基线检测方法在跨谎言类型迁移时常常泛化失败,尤其是当无法仅从对话记录推断出谎言时。 为了理解这些欺骗表示出现的位置,几项工作研究了诚实性和欺骗是否可以内部激活直接恢复。Azaria 和 Mitchell (2023 (https://arxiv.org/html/2607.20479#bib.bib3)) 表明,基于隐态训练的分类器可以从 LLM 的内部表示预测陈述是真还是假,而 Pacchiardi 等人 (2024 (https://arxiv.org/html/2607.20479#bib.bib19)) 则证明,欺骗行为也可以在黑盒设置下通过提出策略上无关的后续问题来检测。这些工作共同表明,欺骗性输出在内部激活和行为模式中都会留下可检测的痕迹,从而激发我们对基于探针方法的关注。 更具体地说,Boxo 等人 (2025 (https://arxiv.org/html/2607.20479#bib.bib4)) 研究了欺骗特征的深度分布。他们报告了一个三阶段模式:早期层接近随机,中间层达到峰值,后期层略有下降。这一见解使得选择较深的探针层成为我们框架中一个合理的经验选择。 针对标准线性探针的局限性,Oldfield 等人 (2026 (https://arxiv.org/html/2607.20479#bib.bib18)) 引入了截断多项式分类器 (TPC)。该论文将 TPC 描述为线性探针的渐进扩展,具有高阶交互,并表明在大型安全数据集上,它能与同尺寸 MLP 探针基线竞争或超越。少量非线性能够捕获特征交互,同时又不使检测器变成不透明的黑盒模型,为我们的评估提供了一个稳健的比较点。 同样探索稳健特征几何学的还有 Bürger 等人 (2024 (https://arxiv.org/html/2607.20479#bib.bib5)),他们证明了当表面形式从肯定句变为否定句时(例如,因为“天空是绿色的”和“天空不是蓝色的”激活了相似的神经元,混淆了“说谎”与“否定”),线性探针常常失效。他们的主要见解是,将激活投影到一个二维子空间(一个方向对应真实性,另一个对应极性)是一种跨数据集泛化的稳健方法。因此,我们纳入 Truth2D 探针,直接测试检测器学习的是欺骗本身,还是仅仅是一种措辞模式。 最后,Goldowsky-Dill 等人 (2025 (https://arxiv.org/html/2607.20479#bib.bib9)) 明确指出,在欺骗场景下仅基于输出的监控是不够的。他们比较了几种方法,包括一种由后续问题“你上一个回复是欺骗性的吗?”构建的探针,并将答案预填为“不”,报告称该方法在欺骗性响应与控制性响应上达到了接近完美的性能。这为我们的评估提供了一个非常强的白盒基线。 ### 2.3. 大型语言模型中的隐态探针 隐态探针已成为机制解释神经网络内部知识的基础技术。里程碑式的工作由 Alain 和 Bengio (2017 (https://arxiv.org/html/2607.20479#bib.bib2)) 完成,他们确立了在中间隐态上使用标准线性探针的方法。在 LLM 的背景下,探针提取诸如无监督的真实世界模型等隐抽象(Burns 等人,2023 (https://arxiv.org/html/2607.20479#bib.bib6))。具体而言,为了识别真实性方向,Marks 和 Tegmark (2024 (https://arxiv.org/html/2607.20479#bib.bib17)) 提供了一种基础的基于几何的方法,而 Zou 等人 (2024 (https://arxiv.org/html/2607.20479#bib.bib25)) 则证明,探针和激活工程可以通过将激活引导至更真实的表示,在推理时直接影响模型诚实性。补充这条研究线的是 Li 等人 (2023 (https://arxiv.org/html/2607.20479#bib.bib14)) 提出的推理时干预 (ITI),该方法在少量注意力头上沿着学习到的真实方向移动模型激活,显著提升了 TruthfulQA 上的诚实性。这些工作共同支持了一个更广泛的观点:与诚实性相关的信息以至少部分可由线性分析和干预访问的形式编码在内部表示中。 有效隐态探针的设计通常围绕三个关键轴:深度、表达能力和稀疏性。深度决定了探针应用的位置;由于 LLM 分层处理信息,像有意欺骗这样的复杂概念往往在中后层成熟,而非早期的标记处理层。表达能力决定了探针的复杂度。虽然标准线性探针高度可解释且不易过拟合,但如果欺骗特征与句法或安全协议纠缠在一起,它们可能失败,从而促使使用非线性或几何变体(Oldfield 等人,2026 (https://arxiv.org/html/2607.20479#bib.bib18);Bürger 等人,2024 (https://arxiv.org/html/2607.20479#bib.bib5))。最后,稀疏性解决了叠加问题,其中稠密隐态将多个不同概念压缩到共享激活空间中(Elhage 等人,2022 (https://arxiv.org/html/2607.20479#bib.bib8))。稀疏自编码器 (SAE) 提供了一种可扩展的无监督方法,可从这些激活中恢复更解缠、更可解释的特征(Huben 等人,2024 (https://arxiv.org/html/2607.20479#bib.bib10))。近期架构改进(如 JumpReLU SAE)进一步在固定稀疏水平上提高了重建保真度,同时不牺牲可解释性(Rajamanoharan 等人,2024 (https://arxiv.org/html/2607.20479#bib.bib22))。此外,最新工作探索了直接在 SAE 衍生的稀疏特征空间上进行探针,表明稀疏表示可能为下游分析任务保留有意义的语义结构(Kantamneni 等人,2025 (https://arxiv.org/html/2607.20479#bib.bib12))。为评估这一轴,我们利用了 Gemma Scope(Lieberum 等人,2024 (https://arxiv.org/html/2607.20479#bib.bib15)),这是一个用于 Gemma 2 的 JumpReLU SAE 开放套件,使我们能够测试稀疏表示相对于标准稠密隐态激活是否能提高欺骗状态的可分性。 ## 3. 方法 我们的框架遵循 Kretschmar 等人 (2025 (https://arxiv.org/html/2607.20479#bib.bib13)) 的一般协议,但通过额外的训练数据、更多的探针族以及一个基于磁盘的激活缓存系统进行了扩展,以提高可重现性和内存效率111我们的代码可在 https://github.com/amrgaber249/Beyond-Liars-Bench 获取。我们的端到端流水线如图 1 所示。 代码库支持三种提取模式:逐标记训练激活、平均池化评估激活以及在最终标记上进行探针的后续条件。为系统测试深度假设而无需进行计算耗时的层扫描,我们评估了两个精心锚定的深度。对于我们的早期层基线,我们在第 20 百分位处提取,方向
相似文章
大语言模型中欺骗探测探头的压力测试:可伸缩性、鲁棒性与欺骗表征的几何特性
本文系统测试了用于大语言模型欺骗检测的线性探头,发现它们在分布偏移下失效,但风格增强型探头能恢复性能,并揭示欺骗是通过分布式亚阈值特征编码的。
当大语言模型学会持续犯错:合成欺骗线性表示的多模型研究
本文通过微调五个Transformer模型的诚实与欺骗变体,研究大语言模型中的合成不诚实行为,发现鲁棒且域不变的不诚实表示可以通过适度的监督微调迅速固化,这对基于激活的监控具有重要意义。
偏好学习中测谎器监督的扩展趋势
本文将SOLiD测谎器监督方法扩展到更大的LLM(参数规模高达405B),并在真实的偏好学习场景中进行评估,发现未检测到的欺骗行为随模型规模增大而减少,但该方法对训练数据之间的分布偏移敏感。
"你撒谎了吗?" 跨模型规模与信念验证模型实体的谎言检测评估
本文评估了四种针对语言模型的谎言检测方法,覆盖了提示谎言和训练好的模型实体,发现基于激活和logprob的检测器在训练好的模型实体上性能急剧下降,而思维链评判器仍然表现强劲。本文引入了新的测试平台以及“你撒谎了吗?”(DYL)后续探针方法,并发布了数据集和模型实体。
DECOR:基于信息操纵理论审计LLM欺骗行为
介绍了DECOR,一个基于信息操纵理论的多智能体框架,用于细粒度审计LLM回应中的策略性欺骗,在15个前沿模型的欺骗检测基准测试中取得了最先进的性能。