训练模型而非读者:可验证激活解释的可解码性监督
摘要
本文表明,基于重建的激活解释测试可能被操纵,从而在特定主张仍然错误的情况下获得高分。论文提出了RECAP方法,该方法与目标模型一起训练线性头,使指定的内部内容能够可靠解码并独立于探针进行验证,从而改进安全审计。
查看缓存全文
缓存时间: 2026/07/24 05:07
论文页面 - 训练模型,而非读者:面向可验证激活解释的可解码性监督
来源:https://huggingface.co/papers/2607.20379
摘要
自然语言自编码器通过重构来评估隐藏激活的解释:如果激活可以从解释中重新生成,则该解释被认为是忠实的。该测试在结构上对个体错误主张不敏感:如果翻转一个主张不会改变重构结果,则该主张永远不会受到惩罚。我们展示了两种通过该测试的方式,但两者都不忠实。在一个已发布的 Qwen-2.5-7B 言语化器上,解释的重构效果显著高于随机水平,但约 2% 的具体主张是重构依赖的,因此评分捕捉的是大意而非具体事实。在精确合成的真实标注下,标准方案在 5/5 次运行中发展出共适应的私有编码(重构所依赖的错误措辞),而保持目标模型不变的修复措施也无济于事。我们贡献了两项审计协议——“基于真实 vs 真实交叉“与“评估器交换”——以及 RECAP(通过共训练辅助预测器实现可读编码):与目标模型一同训练的线性头部,以保持指定内容可解码。在 RECAP 训练的沙盒模型上,新的言语化器能够真实陈述指定内容且编码消失,代价仅为 +0.001 纳特。这一点在预训练的 Pythia-160M 上得到复现:内容变得可靠地可通过探针解码,尽管新的言语化器仅能部分传达(真实度 0.44-0.46 vs 接近零的对照组)。对于可解释性而言,高重构并不能证明个体主张的真实性。对于 AI 安全,RECAP 使得指定的内部内容可以独立地通过探针进行核查,而非依赖模型可能操控的散文式陈述:独立探针对言语化器的真实主张评分高于虚假主张(AUC 0.96,而不使用 RECAP 为 0.82)。面对一个通过编辑解释以最大化重构分数同时撒谎的对手(压制了约 87% 的谎言惩罚),RECAP 探针仍能标记谎言(AUC 0.95),而对照探针则降至随机水平(0.51)。
查看 arXiv 页面 (https://arxiv.org/abs/2607.20379)查看 PDF (https://arxiv.org/pdf/2607.20379)添加至收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.20379)
在您的代理中获取此论文:
hf papers read 2607\.20379
没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用该论文的模型0
无模型关联此论文
请在模型 README.md 中引用 arxiv.org/abs/2607.20379 以在此页面建立链接。
引用该论文的数据集0
无数据集关联此论文
请在数据集 README.md 中引用 arxiv.org/abs/2607.20379 以在此页面建立链接。
引用该论文的 Space0
无 Space 关联此论文
请在 Space README.md 中引用 arxiv.org/abs/2607.20379 以在此页面建立链接。
包含此论文的收藏集1
相似文章
解码推理型LLM中隐藏的欺骗:用于欺骗审计的激活解释器
提出了STATEWITNESS,一种用于审计推理型LLM中欺骗的激活解释器,相比现有监测器取得了显著改进,并提供了可供人工检查的证据。
形式验证证书的循环一致性神经解释
本文提出了一种循环一致的神经架构,能生成形式验证证书的忠实自然语言解释,正确性达到90%,推理速度比LLM基线快860倍。
REVES: REVES:修订与验证增强的测试时扩展训练
提出REVES,一种两阶段迭代框架,交替进行数据增强与策略优化,通过利用中间修正步骤提升LLM推理能力,在编程基准测试和约束满足问题上取得更优性能。
对抗游戏提高语言模型输出的可读性
# 对抗游戏提高语言模型输出的可读性 来源: [https://openai.com/index/prover-verifier-games-improve-legibility/](https://openai.com/index/prover-verifier-games-improve-legibility/) 确保语言模型生成可理解的文本对于提高其实用性至关重要,尤其是在处理复杂任务(如解决数学问题)时。我们发现,当我们仅针对获得正确答案来优化强大模型的问题求解过程时
Vernier: 探究因果推理中词汇缺口背后的表征错位
本文探究了为何指令调优的语言模型在将变量名替换为占位符后,对因果推理问题给出不同答案,发现问题源于表征错位而非信息丢失。作者引入了Vernier方法,通过配对视图权重更新和机制检查,揭示出答案相关内容在占位符视图中仍然存在但错位。