掩码非模型:审计注意力、状态空间和混合序列模型中的前缀不变性
摘要
本文介绍了一种审计注意力、状态空间和混合序列模型中前缀不变性的方法,表明注意力掩码无法确保因果性,在多个模型检查点中检测到192个故障。
查看缓存全文
缓存时间: 2026/08/26 03:17
论文摘要 - 掩码非模型:审视注意力、状态空间与混合序列模型中的前缀不变性
来源:https://huggingface.co/papers/2608.22876 领域内通用的因果性验证方式——检查注意力掩码——已无法覆盖绝大多数计算图。
混合架构将注意力机制与扫描操作结合,而扫描操作本身并无掩码。因此,我们形式化定义了掩码本应保证的属性:前缀不变性——位置t的表征不得依赖t之后的输入。因果性是图层级属性,而非掩码属性。
审计过程仅需两次前向传播:输入仅末位不同的x与x’,钩取所有层,比对前缀表征,报告首个满足Δ > τ的层。无需训练、无需梯度、无需标签标签,CPU秒级即可完成。
审计发现
8个检查点共注入192个故障。传统注意力掩码检测识别出0个,而本审计方法精准定位了全部192个故障至具体层级。基于Transformer 5.7.0源码的静态普查,仅凭源码即可预测哪些已发布模型会泄露信息。参考实现中的modelling_mamba2.py沿输入块轴递减跨块循环;modelling_zamba2.py与modelling_nemotron_h.py则沿输出块轴递减——仅一个轴向的差异。动态审计完全验证了预测:Zamba2-1.2B在序列长度256(其声明的块大小)时开始泄露;Nemotron-H-8B在128(其声明的块大小)时泄露。所有合规实现(Bamba-9B、Falcon-H1、Granite-4.0-H、Mamba2、RecurrentGemma)均通过验证。
两条必要准则
未经同检查点正对照检验的“清洁“结论毫无意义。我们曾遇输入不同但输出完全一致的检查点——Δ全局为零,看似完美实则无意义。审计长度必须超越架构的块/窗口参数:默认T=48时Zamba2显示为清洁,因其块大小为256,错误分支从未触发。我们还以3倍自身窗口宽度重新审计两个清洁模型,确认阳性发现并非简单延长序列导致的假象。
为何不设代码仓库:此为刻意设计,附录A.1详述缘由。该方法仅需在标准前向钩子上增加五行算术——约一小时即可针对任何可枚举层级的模型重新实现。独立重实现比运行我们的二进制文件更具复现价值。因此我们直接发布度量数据:完整审计日志、确切检查点标识符、每个清洁扫描与注入实验的逐层数组,以及注入故障规范。论文中所有数字复现或质疑所需信息均已包含。
明确范围:缺陷存在于PyTorch分段扫描路径(torch_forward/segment_sum),仅在未使用融合内核时触发。部分检查点因环境限制无法加载,对此不做断言。
因果泄露不会导致崩溃,反而会降低训练损失与困惑度——使你用于模型选择的指标看起来更优。正是这种不对称性,我们认为因果正确性证书应与模型参数量并列发布。
乐意探讨阈值选择、ε扫描判别器或该变换关系的其他应用场景。
相似文章
视觉-语言模型中可靠性的所在:注意力、隐藏状态与因果电路的机制研究
本文通过证明注意力图的尖锐度并非视觉-语言模型正确性的良好预测指标,挑战了“注意力-置信度假设”。相反,研究表明,隐藏状态的几何特征和自一致性更能反映模型的可靠性,并揭示了晚期融合模型与早期融合模型在架构上的显著差异。
有限记忆语言模型中的遗忘审计
本文提出了一种因果审计框架,通过在推理过程中改变数据库状态来评估有限记忆语言模型中的遗忘情况,发现参数泄漏可忽略不计,删除后的正确性主要源于检索伪影而非残留的参数记忆。
出于必要性的偏差:收敛式人工智能与人类验证中顺序处理的不可能性定理
本文证明了不可能性定理,表明由于因果掩码(causal masking)约束,首要效应(primacy effects)、锚定效应(anchoring)和顺序依赖性(order-dependence)是自回归语言模型中架构上必然存在的偏差。作者跨越12种前沿大语言模型验证了这些理论界限,并通过涉及工作记忆负荷的预注册人类实验证实了相关预测。
掩盖过时观察有助于搜索代理——直到它不再有效:一个机制图谱及其机理
本文研究了长程搜索代理中的观察掩盖技术,发现准确率的提升呈现不对称倒U形,取决于检索器能力与模型容量的相互作用,当模型饱和时会出现崩溃。本文提供了机制分析及上下文管理的机制图谱。
The Inattentional Gap: 任务条件化的语言与视觉模型会忽略本可报告的安全关键信号
本文识别出'Inattentional Gap'现象,即任务条件化的AI模型会抑制报告其本可检测到的安全关键信号,类似于人类的非注意盲视,这挑战了基准性能即可确保现实世界安全的假设。