在受限API访问下对LLM架构属性的黑盒推断

arXiv cs.LG 论文

摘要

本文介绍NightVision,一种利用受限黑盒API访问来估计大型语言模型隐藏维度、深度和参数数量的攻击方法。它采用新颖的公共集提示技术与频谱分析,在开源模型上实现了高精度。

arXiv:2607.01313v1 公告类型:新 摘要:在实践中,大多数商业LLM提供商不会公开发布其底层LLM架构的详细信息。然而,先前的研究表明,在有限的API访问权限(即top-$k$ logits和/或logit偏置函数)下,可以恢复LLM的某些架构细节,如前馈网络的隐藏维度。或许是为了应对这些结果,大多数商业LLM提供商已限制其API仅暴露每个解码token的单个logit,并且不再允许用户偏置logits。我们证明,即使在当前受限的API下,若干架构参数仍然可被恢复。我们提出NightVision,一种利用受限黑盒API访问来估计LLM隐藏维度、深度和参数数量的攻击方法。算法上,NightVision依赖于一种新颖的公共集提示技术,该技术通过多个提示暴露同一组输出token的对数概率;对这些结果进行频谱分析以推断隐藏维度。此外,NightVision利用端到端的首个token时间(TTFT)测量和估计的隐藏维度来估计深度和参数数量。我们在32个开源LLM上对NightVision进行了实证评估,在所有模型上恢复隐藏维度的平均相对误差为23%(在MoE模型上为9%),对于超过30亿参数的模型,深度和参数数量的误差在53%以内。我们进行了广泛的消融实验,以展示这些精度如何随token预算和模型属性变化。总体而言,我们的结果表明,当前的LLM API并未充分限制到足以完全混淆其底层模型的架构细节。
查看原文
查看缓存全文

缓存时间: 2026/07/03 05:39

# 黑盒推断LLM架构属性在限制性API访问下的可行方法 来源:https://arxiv.org/html/2607.01313 Christopher Ellis 卡内基梅隆大学 匹兹堡,宾夕法尼亚州 15213 crellis@andrew\.cmu\.edu &Shreyas Chaudhari∗ 卡内基梅隆大学 匹兹堡,宾夕法尼亚州 15213 shreyasc@andrew\.cmu\.edu &Mei\-Yu Wang∗ 匹兹堡超级计算中心 匹兹堡,宾夕法尼亚州 15213 mwang7@psc\.edu &Leighton Barnes 卡内基梅隆大学 匹兹堡,宾夕法尼亚州 15213 leightonb@cmu\.edu &Giulia Fanti 卡内基梅隆大学 匹兹堡,宾夕法尼亚州 15213 gfanti@andrew\.cmu\.edu &José M\. F\. Moura 卡内基梅隆大学 匹兹堡,宾夕法尼亚州 15213 moura@andrew\.cmu\.edu ###### 摘要 实际上,大多数商业LLM提供商不会公开发布底层LLM架构的细节。然而,先前的研究表明,在有限的API访问权限下(即,Top- kk logit值和/或logit偏置函数),可以恢复LLM的某些架构细节,例如前馈网络的隐藏维度。或许是为了应对这些结果,大多数商业LLM提供商已经限制了其API,仅暴露每个解码token的单个logit值,并且不再允许用户偏置logit。我们证明,即使在当前限制性API下,某些架构参数仍然可以被恢复。我们提出了NightVision,一种攻击方法,利用限制性黑盒API访问来估计LLM的隐藏维度、深度和参数数量。在算法上,NightVision依赖于一种新颖的“公共集”提示技术,其中多个提示对同一组输出token暴露log概率;对这些结果进行谱分析以推断隐藏维度。NightVision还利用端到端的首token时间(TTFT)测量和估计的隐藏维度来估计深度和参数数量。我们在32个开源LLM上实验评估了NightVision,所有模型的隐藏维度平均相对误差在23%以内(MoE模型为9%),对于超过三十亿参数的模型,深度和参数数量的平均相对误差在53%以内。我们进行了广泛的消融实验,以展示这些精度如何随token预算和模型属性变化。总体而言,我们的结果表明,当前的LLM API限制不足以完全隐藏其底层模型的架构细节。 ## 1 引言 攻击者能否仅通过API访问推断大型语言模型的架构属性,例如其隐藏维度、深度或总参数数量?这个问题对LLM开发者和服务器提供商都极具吸引力,他们可能希望保持其超参数和相关模型知识产权秘密(Tramèr等人,2016 (https://arxiv.org/html/2607.01313#bib.bib34))。这也与安全研究人员和数字取证专家相关,他们可能需要描述在野外遇到的未知LLM API。因此,黑盒架构推断的可行性对API设计(Hartenstein,2025 (https://arxiv.org/html/2607.01313#bib.bib29);Liu等人,2026 (https://arxiv.org/html/2607.01313#bib.bib30))和模型审计(Amirizianini等人,2024 (https://arxiv.org/html/2607.01313#bib.bib31);Mökander等人,2024 (https://arxiv.org/html/2607.01313#bib.bib32);Rastogi等人,2023 (https://arxiv.org/html/2607.01313#bib.bib33))都有直接影响。 最近的黑盒攻击(Zhao等人,2025 (https://arxiv.org/html/2607.01313#bib.bib37))表明,通过输出logit的谱分析可以恢复隐藏维度和最终层权重(在正交变换范围内)(Carlini等人,2024 (https://arxiv.org/html/2607.01313#bib.bib14);Finlayson等人,2024 (https://arxiv.org/html/2607.01313#bib.bib13))。这些攻击关键依赖于**完整的log概率**或**logit偏置**参数,该参数允许攻击者从Top- kk概率重建完整的logit向量。作为回应,随着现代语言模型API的不断发展(Chauvin等人,2025 (https://arxiv.org/html/2607.01313#bib.bib38)),提供商已开始限制对Top- kk logit和logit偏置的访问(Carlini等人,2024 (https://arxiv.org/html/2607.01313#bib.bib14)),使得这些攻击在类似API上不再适用。一个自然的问题是,在模拟当前前沿模型的更具限制性的API下,架构推断是否仍然可行。我们给出肯定答案。假设仅暴露每一步解码的**单个**token的log概率(与当代LLM API一致的最小概率信息)以及端到端响应时间(这很难隐藏),我们不仅恢复了隐藏维度,还恢复了深度和总参数数量,误差在一定范围内。 贡献。我们的贡献有三点,总结如下。总体而言,我们的结果表明,即使在限制性API访问下,对敏感架构属性进行有意义的推断仍然是可能的,并且要关闭这一渠道,除了限制logit访问外,还需要防御定时侧信道。 *(1)算法:*我们引入了NightVision,一种双管齐下的推断算法,利用黑盒API访问联合恢复基于Transformer的LLM架构的隐藏维度、深度和参数数量。NightVision的第一个分支引入了**公共集提示**(common-set prompting),一种新颖的方法,可在单logit API访问下恢复隐藏维度,无需logit偏置或Top- kk访问。其次,我们开发了一种**基于时间的恢复**程序,用于深度和参数数量,该程序利用了以预填充为主的Transformer推理随深度、序列长度和隐藏维度的独特缩放特性;此阶段将我们的隐藏维度估计作为构建块。 *(2)理论:*我们在第4.1.2节 (https://arxiv.org/html/2607.01313#S4.SS1.SSS2) 中分析限定了NightVision成功恢复所需“公共集”所需的API调用次数。通过对多个提示中随机采样token集合的交集大小进行集中论证,我们推导出一个样本复杂度结果,该结果量化了每个提示需要多少个样本才能形成目标大小的公共集,或者等价地,在固定样本预算下,可以高概率恢复的最大隐藏维度。 *(3)实验:*我们在32个开源LLM上评估了NightVision,结果显示其恢复的隐藏维度平均相对误差在23%以内(32个案例中有4个完全恢复,12个在10%以内)。在隐藏维度估计准确的前提下,NightVision在参数超过≥3B的模型上恢复的深度和总参数数量平均相对误差约为~53%。我们估计的精度部分取决于NightVision获得的token**预算**。我们还提供了估计精度如何随预算和架构属性变化的细粒度特征描述。 ## 2 技术预备知识 ##### LLM的架构参数。大多数LLM可以建模为 LL 个Transformer解码器层的堆叠(Vaswani等人,2017 (https://arxiv.org/html/2607.01313#bib.bib39))。在这些架构中,每个Transformer块处理固定维度 dd 的隐藏表示。我们将 LL 称为**深度**, dd 称为**隐藏维度**, PP 称为整个架构的**参数数量**;它们共同决定了推理成本、内存占用和能力,并且通常被LLM提供商视为专有信息。隐藏维度 dd 提供了一个特别清晰的恢复目标:下一个token的logit由 z=Wh\mathbf{z}=\mathbf{W}\mathbf{h} 产生,其中 h∈Rd\mathbf{h}\in\mathbb{R}^{d} 是最后一层的隐藏状态, W∈R|V|×d\mathbf{W}\in\mathbb{R}^{|\mathcal{V}|\times d} 是在词汇表 V\mathcal{V} 上的输出嵌入矩阵。由于实践中 |V|≫d|\mathcal{V}|\gg d ,跨越多个提示收集的logit矩阵的秩最多为 dd 。这个**softmax瓶颈**是先前攻击(Carlini等人,2024 (https://arxiv.org/html/2607.01313#bib.bib14);Finlayson等人,2024 (https://arxiv.org/html/2607.01313#bib.bib13))以及我们在第̃4.1.1节 (https://arxiv.org/html/2607.01313#S4.SS1.SSS1.Px3) 中的谱方法所利用的结构性事实。 ##### 威胁模型。考虑一个**目标模型** φ\varphi ,它由堆叠的Transformer块组成,每个块具有相同的隐藏维度 dd 和深度 LL ,这与现代LLM架构中常见的情况一致。给定对 φ\varphi 的API访问权限,我们的目标是估计 dd 、 LL 和参数数量 PP 。给定输入序列 S=(x1,...,xt−1)S=(x_{1},\dots,x_{t-1}) ,LLM产生一个下一个token的logit向量 zS∈R|V|\mathbf{z}_{S}\in\mathbb{R}^{|\mathcal{V}|} ,条目为 zS(i)z_{S}^{(i)} 。许多API暴露一个温度参数 τ>0\tau>0 ,它在softmax之前重新缩放logit,得到一个概率向量 pS(τ)=softmax(zS/τ)∈Δ|V|−1\mathbf{p}_{S}(\tau)=\mathrm{softmax}(\mathbf{z}_{S}/\tau)\in\Delta^{|\mathcal{V}|-1} ,条目为 pS(i)(τ)=exp(zS(i)/τ)/∑jexp(zS(j)/τ)=P(xt=vi∣x1,...,xt−1)p_{S}^{(i)}(\tau)\!=\!\exp(z_{S}^{(i)}/\tau)/\sum_{j}\exp(z_{S}^{(j)}/\tau)\!=\!\mathbb{P}(x_{t}=v_{i}\mid x_{1},\dots,x_{t-1}) ,以及相应的log概率向量 yS(τ)\mathbf{y}_{S}(\tau) ,条目为 yS(i)(τ)=logpS(i)(τ)y_{S}^{(i)}(\tau)\!=\!\log p_{S}^{(i)}(\tau) ;较大的 τ\tau 使分布变得平坦,趋向均匀分布,而 τ=1\tau=1 恢复未缩放的分布 pS≜pS(1)\mathbf{p}_{S}\triangleq\mathbf{p}_{S}(1) 。我们使用 viv_{i} 表示 i∈[|V|]i\in[|\mathcal{V}|] 中的第 ii 个token标签。 我们在受限的黑盒设置中操作,其中 zS\mathbf{z}_{S} 、 zS(τ)\mathbf{z}_{S}(\tau) 、 pS\mathbf{p}_{S} 或 pS(τ)\mathbf{p}_{S}(\tau) 均不可观察。一旦模型通过从 pS(τ)\mathbf{p}_{S}(\tau) 中采样解码出一个下一个token vi0v_{i_{0}} ,只有实现的log概率 yS(i0)(τ)y_{S}^{(i_{0})}(\tau) 被披露。当提示被索引为 SqS_{q} (如我们在第̃4.1节 (https://arxiv.org/html/2607.01313#S4.SS1) 中的公共集构造),我们缩写 zq(i)≜zSq(i)z_{q}^{(i)}\triangleq z_{S_{q}}^{(i)} 、 pq(i)≜pSq(i)p_{q}^{(i)}\triangleq p_{S_{q}}^{(i)} 和 yq(i)≜ySq(i)y_{q}^{(i)}\triangleq y_{S_{q}}^{(i)} 。因此,我们的威胁模型严格弱于(给攻击者的信息更少)Carlini等人 (2024 (https://arxiv.org/html/2607.01313#bib.bib14)) 和Finlayson等人 (2024 (https://arxiv.org/html/2607.01313#bib.bib13)) 的模型,后者额外授予 pS(τ)\mathbf{p}_{S}(\tau) 的Top- kk条目或在最终softmax之前的logit偏置控制。我们的公共集提示方法(第̃4.1节 (https://arxiv.org/html/2607.01313#S4.SS1))受益于更平坦的分布,因此我们使用 τ=2\tau=2 (大多数当前API的上限)。 ## 3 相关工作 Carlini等人 (2024 (https://arxiv.org/html/2607.01313#bib.bib14)) 和Finlayson等人 (2024 (https://arxiv.org/html/2607.01313#bib.bib13)) 同时展示了可以通过利用softmax瓶颈从API访问中恢复LLM的隐藏维度:跨多个提示的输出logit矩阵的秩等于隐藏维度,可以通过奇异值分解轻松确定。Carlini等人 (2024 (https://arxiv.org/html/2607.01313#bib.bib14)) 进一步恢复了最终输出层直至正交变换。关键的是,这两种方法都依赖于logit偏置参数,以从API的Top- kk log概率输出(其中 k≥1 )重建完整的logit向量(Morris等人,2023 (https://arxiv.org/html/2607.01313#bib.bib36)),一旦移除此功能,这两种方法都将失效。我们在第̃4.1节 (https://arxiv.org/html/2607.01313#S4.SS1) 中提供了我们的方法与Carlini等人 (2024 (https://arxiv.org/html/2607.01313#bib.bib14)) 方法的详细算法比较。 表1:先前从生产LLM API中黑盒恢复架构属性的工作。左侧块显示了攻击**需要**的访问权限;右侧块显示了它**恢复**的内容。所有先前恢复隐藏维度的攻击都需要一个logit偏置参数(用于从单个解码的log概率**重建**完整的logit向量,这就是为什么“完整logit”未勾选),这是一个主要提供商已移除或限制的功能,以应对这些结果。 | 所需访问权限 | | | | | 恢复内容 | | | | :--- | :--- | :--- | :--- | :--- | :--- | :--- | :--- | | 工作 | 仅文本 | 完整logit | Logit偏置 | 单log概率 | 推理时间 | 隐藏维度 | 深度 | #参数 | | Carlini等人 (2024) | ✓ | | ✓ | | | ✓ | | | | Finlayson等人 (2024) | ✓ | | ✓ | | | ✓ | | | | Li (2026) | ✓ | | | | | | | ✓ | | NightVision(基础公共集) | ✓ | | | ✓ | | ✓ | | | | NightVision(含时间) | ✓ | | | ✓ | ✓ | ✓ | ✓ | ✓ | 最近,Li (2026) (https://arxiv.org/html/2607.01313#bib.bib27) 采用了另一种方法,与其探测模型内部,不如尝试探测模型学到了什么。他们的方法,*不可压缩知识探测*(IKPs),测试模型关于晦涩事实问题,这些问题的答案无法从一般推理中推断,而必须存储在模型权重中。由于存储更多事实需要更多参数,模型在这些探测上的准确度可以作为其大小的代理,一旦针对已知大小的开放权重模型进行校准。表1 (https://arxiv.org/html/2607.01313#S3.T1) 按威胁模型将我们的工作与这些方法进行了对比,即每种攻击所需的API访问权限,以及它恢复的架构属性。我们的方法在恢复隐藏维度的任何方法中需要严格最弱的概率API访问,并且是唯一联合恢复深度、隐藏维度和参数数量的方法。由于空间限制,我们在附录A (https://arxiv.org/html/2607.01313#A1) 中讨论其他相关工作。 ## 4 NightVision:算法与分析 参见图注 图1:NightVision概述 我们首先概述NightVision,如图1 (https://arxiv.org/html/2607.01313#S4.F1) 所示,然后详细解释其组成部分。NightVision分两个阶段进行。第一阶段,我们称之为**公共集提示攻击**,用于恢复隐藏维度 dd (第̃4.1节 (https://arxiv.org/html/2607.01313#S4.SS1))。第二阶段,我们称之为**时间攻击**,给定第一阶段获得的隐藏维度估计 d^\hat{d} ,恢复参数数量和深度(第̃4.2节 (https://arxiv.org/html/2607.01313#S4.SS2))。给定攻击的总token预算 BB (我们发现实践中对于数十亿参数的LLM需要 B>2×1011B>2\times 10^{11} token),我们将前1000万个token分配给时间攻击,其余分配给公共集提示攻击。 ### 4.1 第一阶段:NightVision公共集提示攻击 我们首先回顾Carlini等人 (2024 (https://arxiv.org/html/2607.01313#bib.bib14)) 在Top-1 logit访问下的攻击,并解释为什么它在现代API下不可行。然后我们提出我们的公共集提示攻击(第̃4.1.1节 (https://arxiv.org/html/2607.01313#S4.SS1.SSS1))并分析其样本复杂度(第̃4.1.2节 (https://arxiv.org/html/2607.01313#S4.SS1.SSS2))。 Carlini等人 (2024 (https://arxiv.org/html/2607.01313#bib.bib14)):Top-11二元logit偏置攻击 | NightVision第一阶段:公共集提示攻击 | | :--- | :--- | | 1: 2: Top-11 log概率API 使用二元偏置 b∈{−1,0}b\in\{-1,0\} 3: 提示 D={Sq}q=1n\mathcal{D}=\{S_{q}\}_{q=1}^{n} 且 n>dn>d | 1: 2: 单个

相似文章

离散扩散语言模型上的成员推断攻击

arXiv cs.LG

本文研究了针对微调掩码扩散语言模型(MDLMs)的成员推断攻击(MIA)。提出了一种白盒攻击,利用模型在不同掩码比率下的重构损失构建46维特征向量,取得了较高的AUC分数,表明MDLMs的脆弱性超出先前预期。

不要让LLM说话,直接探测它(8分钟阅读)

TLDR AI

本文介绍了一种技术,该技术从LLM的最后一个提示标记处提取隐藏状态,无需文本生成即可进行分类,使用一个小型MLP读取模型的内部决策,从而实现快速且廉价的零样本分类器。