训练模型而非读者:可验证激活解释的可解码性监督

Hugging Face Daily Papers 论文

摘要

本文表明,基于重建的激活解释测试可能被操纵,从而在特定主张仍然错误的情况下获得高分。论文提出了RECAP方法,该方法与目标模型一起训练线性头,使指定的内部内容能够可靠解码并独立于探针进行验证,从而改进安全审计。

自然语言自编码器通过重建来评分隐藏激活的解释:如果可以从解释中重新生成激活,则解释被认为是忠实的。该测试在结构上对个别虚假主张不敏感:如果翻转一个主张不会改变重建结果,则该主张永远不会受到惩罚。我们展示了该测试通过两种方式被通过,且两种方式都不忠实。在已发布的Qwen-2.5-7B 口头表达器上,解释的重建效果远高于随机水平,而约2%的特定主张是重建依赖的,因此评分追踪的是大意而非具体事实。在精确的合成真实标签下,标准配方在5/5次运行中发展出共适应的私有编码(重建依赖的虚假措辞),并且不改变目标模型的修复也无济于事。我们贡献了两个审计协议:基于真实标签的交叉验证和评估器交换,以及RECAP(通过共同训练的辅助预测器实现可读编码):与目标模型一起训练线性头,以保持指定的内容可解码。在RECAP训练的沙盒模型上,新的口头表达器真实地陈述了指定内容,且编码消失,成本为+0.001 nat。这在一个预训练的Pythia-160M模型上得到复现:内容变得可靠地可被探针解码,尽管新的口头表达器仅部分传达了它(真实性0.44-0.46,而对照组接近零)。就可解释性而言,高重建并不能证明单个主张的正确性。就人工智能安全而言,RECAP使得指定的内部内容可以独立地通过探针进行检查,而不是通过模型可能操纵的散文来断言:独立的探针对口头表达器的真实主张评分高于虚假主张(AUC 0.96,而没有RECAP时为0.82)。面对一个试图通过编辑解释以最大化重建分数同时撒谎的对手(压制了约87%的谎言惩罚),RECAP探针仍然能标记谎言(AUC 0.95),而对照组探针降至随机水平(0.51)。
查看原文
查看缓存全文

缓存时间: 2026/07/24 05:07

论文页面 - 训练模型,而非读者:面向可验证激活解释的可解码性监督

来源:https://huggingface.co/papers/2607.20379

摘要

自然语言自编码器通过重构来评估隐藏激活的解释:如果激活可以从解释中重新生成,则该解释被认为是忠实的。该测试在结构上对个体错误主张不敏感:如果翻转一个主张不会改变重构结果,则该主张永远不会受到惩罚。我们展示了两种通过该测试的方式,但两者都不忠实。在一个已发布的 Qwen-2.5-7B 言语化器上,解释的重构效果显著高于随机水平,但约 2% 的具体主张是重构依赖的,因此评分捕捉的是大意而非具体事实。在精确合成的真实标注下,标准方案在 5/5 次运行中发展出共适应的私有编码(重构所依赖的错误措辞),而保持目标模型不变的修复措施也无济于事。我们贡献了两项审计协议——“基于真实 vs 真实交叉“与“评估器交换”——以及 RECAP(通过共训练辅助预测器实现可读编码):与目标模型一同训练的线性头部,以保持指定内容可解码。在 RECAP 训练的沙盒模型上,新的言语化器能够真实陈述指定内容且编码消失,代价仅为 +0.001 纳特。这一点在预训练的 Pythia-160M 上得到复现:内容变得可靠地可通过探针解码,尽管新的言语化器仅能部分传达(真实度 0.44-0.46 vs 接近零的对照组)。对于可解释性而言,高重构并不能证明个体主张的真实性。对于 AI 安全,RECAP 使得指定的内部内容可以独立地通过探针进行核查,而非依赖模型可能操控的散文式陈述:独立探针对言语化器的真实主张评分高于虚假主张(AUC 0.96,而不使用 RECAP 为 0.82)。面对一个通过编辑解释以最大化重构分数同时撒谎的对手(压制了约 87% 的谎言惩罚),RECAP 探针仍能标记谎言(AUC 0.95),而对照探针则降至随机水平(0.51)。

查看 arXiv 页面 (https://arxiv.org/abs/2607.20379)查看 PDF (https://arxiv.org/pdf/2607.20379)添加至收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.20379)

在您的代理中获取此论文:

hf papers read 2607\.20379

没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用该论文的模型0

无模型关联此论文

请在模型 README.md 中引用 arxiv.org/abs/2607.20379 以在此页面建立链接。

引用该论文的数据集0

无数据集关联此论文

请在数据集 README.md 中引用 arxiv.org/abs/2607.20379 以在此页面建立链接。

引用该论文的 Space0

无 Space 关联此论文

请在 Space README.md 中引用 arxiv.org/abs/2607.20379 以在此页面建立链接。

包含此论文的收藏集1

相似文章

对抗游戏提高语言模型输出的可读性

OpenAI Blog

# 对抗游戏提高语言模型输出的可读性 来源: [https://openai.com/index/prover-verifier-games-improve-legibility/](https://openai.com/index/prover-verifier-games-improve-legibility/) 确保语言模型生成可理解的文本对于提高其实用性至关重要,尤其是在处理复杂任务(如解决数学问题)时。我们发现,当我们仅针对获得正确答案来优化强大模型的问题求解过程时

Vernier: 探究因果推理中词汇缺口背后的表征错位

arXiv cs.CL

本文探究了为何指令调优的语言模型在将变量名替换为占位符后,对因果推理问题给出不同答案,发现问题源于表征错位而非信息丢失。作者引入了Vernier方法,通过配对视图权重更新和机制检查,揭示出答案相关内容在占位符视图中仍然存在但错位。