真相从未消失:顺从语境真值探针中的完美混叠
摘要
本文识别了AI模型真值探针中的'完美混叠'现象,即在顺从语境下训练的探针无法区分真实情况与预设操作,并展示了混合语境训练能提升检测效果。
查看缓存全文
缓存时间: 2026/09/11 08:17
# 真相从未消失:合规上下文真实探测中的完美别名现象
来源:https://arxiv.org/html/2609.10739
## 真相从未消失:合规上下文真实探测中的完美别名现象
致谢:代码与汇总结果:https://github.com/dylanjayabahu/perfect-aliasing
###### 摘要
在真实报告与任务规定动作重合的合规上下文中拟合的真相探测器,仅凭其拟合标签无法区分这两类目标。我们称这种语义识别失效为**完美别名**。在受控的二元报告博弈中,针对合规上下文拟合的真实探测器与规定动作探测器解决了相同的优化问题。在对抗上下文中,它们的标签互补,导致其AUROC值之和恒为1;这一等式在所有751个单元-层对上以浮点精度成立。我们通过随机化码本将规定输出符号与语义动作分离,再通过在混合合规与对抗上下文中拟合,将真实与规定动作分离。对于在所有评估的对抗试验中均作虚假回答的、经奖励训练的Gemma-2-9B策略,传统探测器在三个训练种子上的得分为0.006±0.005,而混合拟合探测器在相同保留激活上得分为1.000。混合拟合使用更多训练样本并可访问带标签的对抗上下文,因此此比较建立的是线性可恢复性,而非分离去相关的好处。我们还展示了两个合规拟合探测器(两者在分布内均完美)在相同对抗激活上的得分为0.080和0.986。这些发现关乎探测器测量的对象:它们并未确立保留的功能性信念、恢复方向的因果使用,或可用的欺骗检测器。论文附带代码与汇总结果。
## 1 引言
残差流上的线性探测器是少数几种已达到实用安全提案的可解释性工具之一。它们成本低廉、无需修改模型,且对受指令欺骗的模型有效。但它们所针对的威胁是涌现式欺骗者:因欺骗行为获得奖励而学会欺骗的策略,此类现象现已在生产级强化学习中有文献记录(MacDiarmid等,2025)。两类证据指向相反方向:指令对探测器在未见过的战略欺骗上可迁移,AUROC为0.96–0.999(Goldowsky-Dill等,2025),这一结果现用于论证探测器作为审计工具的价值。然而探测器在训练压力下也会退化:一旦模型因规避探测器而受奖励,令牌级监控器变得高度脆弱(Gupta和Jenner,2025);仅风格变化就能使27B探测器在标准训练下降至随机水平(Kumar,2026);最接近威胁模型的是,在从未针对探测器优化的普通RLVR后,域外AUC降至0.376(Taufeeque等,2026)。提示欺骗也报告了可比的低于随机的数值0.374(Natarajan等,2026)。我们按作者原样陈述这些数字,因为其分布与论证相关。0.376是四个模型的均值,标准差为0.261,因此“低于随机”在那里是广泛分布的平均值;Kumar(2026)将其崩溃归因于训练分布过于狭窄,并通过风格增强训练恢复了近乎完美的检测;Gupta和Jenner(2025)以对抗方式优化监控器,这与普通RL的威胁模型不同,发现最大池化和注意力探测器保持稳健,而令牌级探测器则不然。因此共识不如常被暗示的那样明确:低于随机的AUROC在奖励训练的欺骗者身上仅有一篇论文报告,且模型间方差很大。低于随机的数值仍引发表征解释:模型已学会隐藏、混淆或停止表征其已知信息。低于随机的读数本身并不证明真相信息丢失。在我们的控制任务中,真实比特在不同拟合分布下仍线性可恢复。合规拟合标签无法区分真实与任务规定答案;在对抗上下文上反转与规定动作读数兼容。这是对探测器失效的替代解释,而非对外部研究失败的归因。饱和度也非反转的充分预测因子:我们自身的反例见附录G。我们的识别论证从分析上证明合规拟合标签无法区分真实与规定动作。我们验证了强制恒等式 action/ally=1−truth/ally 在每个记录层、每个单元上成立。随机化码本在合规上下文*内部*将规定输出符号与语义动作分离;混合上下文拟合进而将真实与规定动作分离。建设性结果(§3.3)在最终层的经验真实AUROC在表1所示模型和臂中四舍五入为1.000,包括一个在未修改RL配方下、在每个评估的对抗试验中作虚假回答的奖励训练策略。单独控制(§4)显示了如何通过针对条件重新拟合探测器可在相同激活上产生矛盾读数。我们也报告了负面结果(附录G),包括我们自己提出然后驳斥的两种解释。一个表面的“涌现特定”反转,最初受种子复制和干预支持,在行为匹配控制下消解(附录F)。
## 2 设置
博弈:系统提示给出一个秘密比特。用户回合自称盟友或对手并请求该比特;模型以单个令牌回答。对盟友的诚实和对对手的欺骗均受奖励(REINFORCE;盟友+1/−1,对手+1.5/−2),因此任何成功策略必须使用关于比特的信息(无论提问者是谁)并产生角色依赖的回答。此奖励结构使博弈成为受控探测测试平台:真实比特由外部提供,而规定答案取决于角色。它不建立独立信念状态或特定计算序列。
两个臂:涌现臂是基础模型加上LoRA适配器(r=16, α=32,应用于q/k/v/o),使用REINFORCE训练直至奖励平台期;指令臂是相同基础模型,无我们的RL训练,使用系统提示指令欺骗对手。历史运行日志报告19/19个原始plain-bit训练运行达到相同奖励平台期;完整的运行包含清单未保留。码本任务训练结果不同(§7)。
随机化码本变体:识别修复。在plain博弈中,语义答案与发出的字符是同一事物,因此任何基于其拟合的探测器无法区分它们。在码本变体中,每次试验抽取新符号对和随机方向,因此*哪个字符表示语义0*随试验变化,将规定输出符号与语义动作去相关化*甚至在盟友上下文内部*。我们以两种方式报告去相关化,并刻意不用第三种。*行为*防护是策略不发出固定字符:发出字母表第一个符号的比例为0.478(盟友)/0.539(对手)。此防护排除了固定表面*字符*,但由于映射每次试验重新随机化,发出固定*意义*的策略也得分≈0.5,且我们的两个臂恰好如此(§3.3)。*表征*防护是分别拟合的truth和token方向之间的夹角,cos在四个单元上为+0.003/−0.006/−0.016/−0.046。我们*不*引用标签级corr(action, token),因为它是码本随机抽样的属性,与任何模型无关:相同值在跨越四种架构和两个臂的11个单元中出现16位有效数字,一个无法跨模型变化的量不是模型的测量。
探测器和读取位置:逐层逻辑探测器读取残差流在最终提示位置的状态,该位置的下一个令牌分布*是*模型的答案。那里尚未生成答案令牌,因此探测器读取的是计算答案的起始状态。我们称此为*答案预测位置*。精度的重要性有两点:它使动作混淆真实存在(答案距矩阵乘法仅一步之遥),并使交叉文本-行为设计在此不可行(§7),因为激活完全由提示决定。我们区分四种记录标签:truth(真实比特),action(任务规定语义答案,盟友时为truth,对手时为其补),token(规定答案映射到字母表第一个还是第二个码本符号),以及emitted(模型实际语义选择)。最后者在两个合法输出符号间贪婪选择,而非无限制词汇生成。规定标签即使在模型不服从时仍被定义。action或token均无法独立测量心理意图或实际输出。我们在纯盟友和混合盟友+对手机制下拟合逐层逻辑探测器。此处“识别”指在拟合设计中分离这些指定的标签替代项,而非独特或普遍有效的真相方向。
采样和拟合:N表示按角色或拆分为拟合与评估集之前收集的总幕数。识别运行使用N=1000或2000,外加N=120的独立试点。固定的70/30按角色分层拆分,为盟友拟合和混合拟合探测器提供公共测试集。混合拟合使用所有训练行(N=1000时700行);盟友拟合仅使用盟友子集,数量约一半。对手AUROC在测试拆分的对手子集上评估,N=1000时约150个幕。行为速率使用相关角色的所有收集幕。表1的运行密钥和记录分母的限制见附录A.1。拟合集大小和带标签对手上下文的可访问性均改变;未运行等预算比较。对于冻结识别探测器,代码评估所有收集的目标幕,因为其未在该运行上拟合。因此冻结与重新拟合识别曲线使用不同评估子集;它们是描述性迁移比较,而非相同测试样本上的配对此估计。保留模板测试在此任务族内的迁移。随机幕拆分未建立向独立模板的泛化,且循环提示配置可能跨拆分出现。
模型:Llama-3.1-8B、Gemma-2-9B、Mistral-7B-v0.3、Qwen2.5-{3,7,14,32}B(4种架构,3B–32B,28–64层);bf16,transformers 4.48.3,每次运行单块H200级GPU。原始负令牌偏移量在聊天模板间不可比,因此跨族位置主张需模板感知锚定(附录A)。
## 3 识别:核心结果
### 3.1 论证
考虑在盟友试验上拟合的探测器。我们的ground-truth和prescribed-action标签在每次此类试验上因构造而重合:truth=action。使用这些标签的任何拟合目标在任一解释下接受相同监督。我们称之为*完美别名*,即附录D中考虑的标签一致率的完全一致极限。在plain-bit博弈中,规定表面符号也重合;随机化码本移除了此附加相等。实际答案不必与规定答案在模型出错的试验上重合。歧义涉及分配给拟合分数的含义。标签相等本身并不证明存在两个不同的线性方向,也不排除数值上唯一的正则化最优解。它显示拟合标签无法在两种目标解释间选择。在对手试验上,规定动作标签是真实的补;与该规定标签对齐的分数将因此反转读取真实。这种可能性防止低于随机的盟友拟合读数单独确立真实信息的移除。该论证不决定哪种解释最佳描述拟合支持集之外的特定拟合。我们的实验展示了对比读数,§4中的重新拟合控制显示通过合规验证的解码器间的分歧。饱和度不是充分预测因子:欺骗度恰为1.000的臂不反转,而另一个较低欺骗度的臂反转(附录G)。
### 3.2 恒等式是强制的,非经验的
该论证做出足够尖锐的预测以供算术检验。因为盟友数据标签向量truth和action*相同*,在盟友数据上拟合“真相探测器”和拟合“动作探测器”是同一优化。两个报告的AUROC是一个拟合方向针对相反标签评分,且AUROC在标签取反下反对称,因此action/ally=1−truth/ally精确成立,每层、每个单元均如此。我们在所有751个(单元,层)对、39条不同完整曲线记录上验证了它;最大偏差为2.2×10^{-16}(图6)。这不是可解释的相关性;这是证明,测量仅检查我们的管道是否计算了我们认为的内容。任何在此补标签评估中报告盟友拟合“真相探测器”AUROC低于0.5的人,等效报告了规定动作AUROC高于0.5,而协议无法分辨他们测量的是哪个。
### 3.3 建设性结果:真相仍在
如果诊断正确,修复方案由其规定:打破*训练数据*中的别名。我们同时做两部分:随机化码本将token与动作去相关,在混合盟友+对手上下文中拟合将真实与动作去相关(表1,图1)。
表 1:相同激活、相同层、相同拟合算法;拟合上下文和样本量不同。来自每次运行收集的N=1000个幕的保留对手试验最终层AUROC;约150个对手测试幕;单元来源见附录A.1。
(请参见标题)
图 1:相同激活、相同层:盟友训练的“真相”探测器反转,而识别探测器读数为1.000。来自每次运行收集的N=1000个幕的保留对手试验逐层真实AUROC(约150个对手测试幕)。红色:传统协议,仅在盟友上下文中拟合相似文章
The Knowing-Saying Gap: When Probes See Errors that Confidence Misses
This paper investigates the 'knowing-saying gap' in language models, showing that linear probes can detect corrupted context with near-perfect accuracy yet fail to predict final answer errors, with implications for deployment monitoring and intervention strategies.
自我判断混淆下正确性探测的诊断
本文研究了神经网络探针在预测语言模型输出正确性时,是否真正捕捉了客观正确性还是模型自身的自我判断。通过构造两者不一致的冲突案例,作者发现可转移的方向主要保持了自我判断的极性,从而挑战了正确性读数的解释。
大语言模型中欺骗探测探头的压力测试:可伸缩性、鲁棒性与欺骗表征的几何特性
本文系统测试了用于大语言模型欺骗检测的线性探头,发现它们在分布偏移下失效,但风格增强型探头能恢复性能,并揭示欺骗是通过分布式亚阈值特征编码的。
RealityTest:人们如何探询AI身份及模型是否披露身份
本文介绍了RealityTest,这是一个多模态、多语言基准测试,用于评估AI系统在被用户探询时是否会披露其身份。该基准基于来自49个国家的真实人类查询数据。研究发现,只有31%的人会直接询问身份,并且人类提出的问题比合成问题更加多样化。结果表明,问题的措辞和对话背景对披露行为的影响比具体模型更大。
真理不是方向:塔斯基对LLM探针的批判
本文提出了一个受塔斯基启发的对角线论证,表明在LLM的嵌入空间上,没有线性探针能够可靠地检测真理,并与哥德尔不完备定理和图灵停机问题进行了类比。该文批判了语言模型中关于真理的线性表示假说。