掩码非模型:审计注意力、状态空间和混合序列模型中的前缀不变性

Hugging Face Daily Papers 论文

摘要

本文介绍了一种审计注意力、状态空间和混合序列模型中前缀不变性的方法,表明注意力掩码无法确保因果性,在多个模型检查点中检测到192个故障。

我们形式化前缀不变性:位置t的表示不能依赖未来的输入。我们提供了一种轻量级审计,只需两次前向传播,无需训练或梯度,即可精确定位因果性中断的位置。注意力掩码检查不完整:即使掩码正确,泄漏也可能通过扫描或归一化发生。在对八个检查点的192次注入故障试验中,掩码检查未发现任何问题,而我们的审计定位了所有192/192个故障,同时在Zamba2和Nemotron-H中发现了缺陷。
查看原文
查看缓存全文

缓存时间: 2026/08/26 03:17

论文摘要 - 掩码非模型:审视注意力、状态空间与混合序列模型中的前缀不变性

来源:https://huggingface.co/papers/2608.22876 领域内通用的因果性验证方式——检查注意力掩码——已无法覆盖绝大多数计算图。

混合架构将注意力机制与扫描操作结合,而扫描操作本身并无掩码。因此,我们形式化定义了掩码本应保证的属性:前缀不变性——位置t的表征不得依赖t之后的输入。因果性是图层级属性,而非掩码属性。

审计过程仅需两次前向传播:输入仅末位不同的x与x’,钩取所有层,比对前缀表征,报告首个满足Δ > τ的层。无需训练、无需梯度、无需标签标签,CPU秒级即可完成。

审计发现

8个检查点共注入192个故障。传统注意力掩码检测识别出0个,而本审计方法精准定位了全部192个故障至具体层级。基于Transformer 5.7.0源码的静态普查,仅凭源码即可预测哪些已发布模型会泄露信息。参考实现中的modelling_mamba2.py沿输入块轴递减跨块循环;modelling_zamba2.py与modelling_nemotron_h.py则沿输出块轴递减——仅一个轴向的差异。动态审计完全验证了预测:Zamba2-1.2B在序列长度256(其声明的块大小)时开始泄露;Nemotron-H-8B在128(其声明的块大小)时泄露。所有合规实现(Bamba-9B、Falcon-H1、Granite-4.0-H、Mamba2、RecurrentGemma)均通过验证。

两条必要准则

未经同检查点正对照检验的“清洁“结论毫无意义。我们曾遇输入不同但输出完全一致的检查点——Δ全局为零,看似完美实则无意义。审计长度必须超越架构的块/窗口参数:默认T=48时Zamba2显示为清洁,因其块大小为256,错误分支从未触发。我们还以3倍自身窗口宽度重新审计两个清洁模型,确认阳性发现并非简单延长序列导致的假象。

为何不设代码仓库:此为刻意设计,附录A.1详述缘由。该方法仅需在标准前向钩子上增加五行算术——约一小时即可针对任何可枚举层级的模型重新实现。独立重实现比运行我们的二进制文件更具复现价值。因此我们直接发布度量数据:完整审计日志、确切检查点标识符、每个清洁扫描与注入实验的逐层数组,以及注入故障规范。论文中所有数字复现或质疑所需信息均已包含。

明确范围:缺陷存在于PyTorch分段扫描路径(torch_forward/segment_sum),仅在未使用融合内核时触发。部分检查点因环境限制无法加载,对此不做断言。

因果泄露不会导致崩溃,反而会降低训练损失与困惑度——使你用于模型选择的指标看起来更优。正是这种不对称性,我们认为因果正确性证书应与模型参数量并列发布。

乐意探讨阈值选择、ε扫描判别器或该变换关系的其他应用场景。

相似文章

有限记忆语言模型中的遗忘审计

arXiv cs.CL

本文提出了一种因果审计框架,通过在推理过程中改变数据库状态来评估有限记忆语言模型中的遗忘情况,发现参数泄漏可忽略不计,删除后的正确性主要源于检索伪影而非残留的参数记忆。

出于必要性的偏差:收敛式人工智能与人类验证中顺序处理的不可能性定理

arXiv cs.AI

本文证明了不可能性定理,表明由于因果掩码(causal masking)约束,首要效应(primacy effects)、锚定效应(anchoring)和顺序依赖性(order-dependence)是自回归语言模型中架构上必然存在的偏差。作者跨越12种前沿大语言模型验证了这些理论界限,并通过涉及工作记忆负荷的预注册人类实验证实了相关预测。