PTP:基于前文标记预测的LLM反演实现近乎精确的提示重建

arXiv cs.CL 论文

摘要

本文提出了PTP,一种功能性LLM反演方法,利用目标黑盒LLM生成的合成数据,从头开始训练一个使用前文标记预测的逆语言模型,从而能够从响应中近乎精确地重建提示,性能优于先前工作。

arXiv:2607.29378v1 公告类型:新 摘要:大型语言模型(LLM)通过自回归采样下一个标记来生成文本。这固有地导致提示与响应之间的多对多映射,使得从观察到的输出推断提示的任务复杂化。先前的LLM反演工作将提示恢复视为语义重建任务。它们依赖于在大型外部数据集上微调预训练的序列到序列模型——并且需要访问模型权重或logits——以生成语义上合理的提示。相比之下,我们提出了一种功能性方法,在无辅助辅助手段的黑盒设置中反演给定LLM。我们完全从头开始在目标LLM自身合成的数据上训练一个显式的逆语言模型。类似于前向的下一个标记预测,我们的逆模型使用前文标记预测进行训练,在前向和逆向过程之间建立了生成性联系,从而能够实现忠实的提示重建。此外,它通过采样自然地支持多样的提示重建,所有这些提示在前向目标LLM下都会引发相似的响应。我们的方法跨数据集泛化,并在从不同LLM生成的响应中重建提示时表现出可迁移性。进一步,在用于提示和响应重建的基于标记的评估指标集合上,我们的方法优于先前工作。
查看原文
查看缓存全文

缓存时间: 2026/08/03 07:36

来源:https://arxiv.org/html/2607.29378  
Pirzada Suhail(IIT Bombay)  
Nagasai Saketh Naidu(Adobe Research)  
Atanu R Sinha(Adobe Research)  
Amit Sethi(IIT Bombay)  

###### 摘要  
大型语言模型(LLMs)通过自回归地采样下一个词元来生成文本。这固有地导致提示与响应之间的多对多映射,使得从观察到的输出推断提示的任务变得复杂。以往关于LLM逆向的研究将提示恢复视为语义重建任务。它们依赖于在大型外部数据集上微调预训练的序列到序列模型——并且需要访问模型权重或logits——以生成语义上合理的提示。相比之下,我们提出一种在黑箱设置中对给定LLM进行逆向的功能性方法,无需任何辅助工具。我们完全从零开始,在由目标LLM自身合成生成的数据上训练一个显式的逆向语言模型。与前向的下一个词元预测类似,我们的逆向模型使用前词元预测进行训练,在前向和逆向过程之间建立了生成性联系,从而实现忠实的提示重建。此外,它通过采样自然地支持多样化的提示重建,所有这些提示在前向目标LLM下都会引发相似的响应。我们的方法在不同数据集上具有泛化性,并且在从不同LLM生成的响应中重建提示时表现出可迁移性。此外,在用于提示和响应重建的基于词元的评估指标集合中,我们的方法优于之前的工作。  
参见图1:我们提出的使用前词元预测的LLM逆向方法。  

## 1 引言  
大型语言模型(LLMs)通常以自回归生成方式训练,使用下一个词元预测(NTP)目标。给定提示x,因果语言模型f学习对每个位置的下一个词元的条件概率进行建模。因此,一旦训练完成,模型可以以自回归方式从左到右生成序列,并以提示x为条件。在这项工作中,我们的目标完全基于其文本响应来逆向预训练的黑箱LLM的行为。具体而言,给定响应y,我们的目标是恢复一个提示x̂,使得f(x̂)≈y。  
我们没有将逆向问题定义为语义重建问题,而是提出了一种功能性方法,它镜像了前向模型本身的生成结构,但方向相反。我们在从目标LLM合成生成的数据上完全从零开始训练一个显式的逆向语言模型,无需访问模型权重、logits或内部表示。为了形式化,考虑语言模型的核心是一个下一个词元预测器,它将输入文本映射到固定词汇表V上的概率分布。具体来说,前向模型f的操作如下:  
f:Context<t→V,即,f(y<t)=P(yt∣y<t)  
相比之下,我们的逆向模型f_inv被训练来执行反向任务:给定未来上下文预测前一个词元:  
f_inv:Context≥t→V,即,f_inv(y≥t)=P(yt−1∣y≥t)  
因此,前向模型通过NTP训练,而逆向模型则学习前词元预测(PTP),如图1所示,重建在给定LLM下会引发观察到的响应的前文上下文。我们的一般逆向公式恢复的x̂可能与生成y的原始提示不完全相同,但会产生相似的结果。这意味着我们的方法可以发现多个提示x̂,它们可以产生与y相似的响应,这在通过削减可能产生这些响应的多样化提示集合来控制不良响应方面特别有用。  

#### 贡献。  
我们的主要贡献包括:  
(1)一种基于*前词元预测*(PTP)的方法,用于数据高效的黑箱LLM逆向,使用从零开始训练的逆向LLM。  
(2)一种基于词汇表级探测目标LLM的合成数据生成策略,无需访问模型内部。  
(3)使用基于PTP的逆向,通过贪心反向解码进行忠实的提示重建,并通过重新查询前向模型进行后续响应重建。  
(4)通过从不同LLM生成的响应中重建提示,展示逆向模型的可迁移性。  

## 2 先前工作  
#### 网络逆向。  
网络逆向已在Kindermann and Linden (1990) (https://arxiv.org/html/2607.29378#bib.bib4)、Jensen et al. (1999) (https://arxiv.org/html/2607.29378#bib.bib3)、Saad and Wunsch (2007) (https://arxiv.org/html/2607.29378#bib.bib12)、Wong (2017) (https://arxiv.org/html/2607.29378#bib.bib15)中被研究,作为理解和可视化神经架构内部机制的一种手段,通过恢复近似给定输出目标的输入模式。除了可解释性之外,逆向也已在对抗性设置中得到探索,Yang et al. (2019) (https://arxiv.org/html/2607.29378#bib.bib16)、Kumar and Levine (2020) (https://arxiv.org/html/2607.29378#bib.bib5)展示了模型逆向攻击,可以在不访问原始训练数据的情况下重建敏感特征,以及不确定性感知的逆向方法Ansari et al. (2022) (https://arxiv.org/html/2607.29378#bib.bib1),将逆向解约束到数据分布的可靠区域。为了解决高度非凸景观中的优化挑战,Liu et al. (2022) (https://arxiv.org/html/2607.29378#bib.bib7)提出学习修改后的损失景观以加速收敛并提高稳定性。生成方法也相继出现,例如Suhail and Sethi (2024) (https://arxiv.org/html/2607.29378#bib.bib14),它使用条件生成器进行卷积神经网络的逆向,同时通过特征空间约束鼓励多样性。最后,确定性公式例如Suhail (2024) (https://arxiv.org/html/2607.29378#bib.bib13),将网络编码为合取范式,并应用SAT求解器和采样器来识别逆向解。  

#### LLM逆向。  
Morris et al. (2023) (https://arxiv.org/html/2607.29378#bib.bib8)研究了*嵌入逆向*,将恢复问题表述为受控生成,迭代解码其嵌入重新编码后接近目标潜向量的文本。作为补充,Morris et al. (2024) (https://arxiv.org/html/2607.29378#bib.bib9)提出了Logit-to-Text(L2T),用于*从下一个词元分布进行提示逆向*,表明模型在词汇表上的概率向量包含关于前文文本的丰富信息。后来,Nazir等人Nazir et al. (2025) (https://arxiv.org/html/2607.29378#bib.bib10)提出了*Prompt Inversion from Logprob Sequences*(PILS),利用下一个词元分布的低维结构来紧凑地表示和聚合跨生成步骤的对数概率,在精确恢复方面取得了显著改进。最近,Nikolaou et al. (2025) (https://arxiv.org/html/2607.29378#bib.bib11)引入了*SipIt*,提出Transformer语言模型是单射的,将离散输入序列映射到连续隐藏表示,从而能够从隐藏激活中可验证地重建精确输入。虽然这些方法有效,但它们从根本上依赖于对预测分布或内部表示的访问,因此不属于完全黑箱设置。  
在黑箱环境中

相似文章

PARTREP:学习在仅解码器LLM中重复什么

arXiv cs.CL

PartRep提出了一种针对仅解码器LLM的选择性提示重复方法,仅追加最有信息量的令牌(通过NLL选择),而非完整提示,从而减少KV缓存和预填充FLOPs,同时在多个基准测试上保留大部分准确率提升。