共享子电路使大语言模型跨任务倒数

arXiv cs.CL 论文

摘要

本文在Llama-3.1-70B-Instruct中识别出一个'倒数子电路',使模型能够跨各种任务追踪剩余令牌,并证明该子电路在不同上下文甚至不同模型中被复用。

arXiv:2607.12279v1 公告类型:新 摘要:写出恰好十二个单词的句子;在正确的密码子处结束DNA序列;格式化ASCII表格。这些都是语言模型能够完成的任务,这些任务需要追踪在达到目标之前还剩多少令牌。在这项工作中,我们在Llama-3.1-70B-Instruct中识别出一个执行这些任务的通用机制:一个“倒数子电路”,它将当前位置与目标长度进行比较,并估算剩余时间。我们首先在一个控制环境中隔离出倒数子电路,该环境要求模型写出一个以指定单词结尾的固定长度句子。然后我们研究了该子电路所用表示的几何结构,发现该子电路使用了先前在另一个独立任务的前沿大语言模型中识别出的相同模式,这表明该模式在模型间是共享的。最后,我们使用无监督探针在自然语言数据集上发现了该子电路被用于多种其他任务,包括目标长度从上下文中推断而非明确给出的任务。我们的工作表明,逆向工程子电路使我们能够理解行为如何从单个示例泛化到许多不同任务甚至模型。
查看原文
查看缓存全文

缓存时间: 2026/07/15 04:22

# 一个共享子电路让LLM能够跨任务倒计数
来源:https://arxiv.org/html/2607.12279
Jacob Dunefsky 耶鲁大学 jacob\.dunefsky@yale\.edu Wes Gurnee Anthropic Emmanuel Ameisen Anthropic

###### 摘要

写一个恰好十二个单词的句子;在正确的密码子处结束DNA序列;格式化ASCII表格。这些都是语言模型能够完成的任务,需要追踪在达到目标之前还剩多少个token。在这项工作中,我们在 Llama-3.1-70B-Instruct 中识别出一个执行这些任务的通用机制:一个“倒计数字电路”,它比较当前位置与目标长度,并估计直到那时剩余的时间。我们首先在受控环境中隔离出一个倒计数字电路,该任务要求模型写一个固定长度的句子,并以指定单词结尾。然后我们研究了该子电路所使用的表示几何结构,发现该子电路使用了先前在另一个任务中在前沿LLM中识别出的相同motif,从而表明此motif在不同模型间是共享的。最后,我们在自然语言数据集上使用无监督探针找到了该子电路被使用的各种其他任务,包括目标长度是从上下文中推断而非明确陈述的任务。我们的工作表明,逆向工程子电路使我们能够理解行为如何从单个示例泛化到许多不同的任务甚至模型。

## 1 引言

机械可解释性旨在逆向工程复杂的神经网络,例如大型语言模型(LLM),以便让人类能够推理它们所实现的算法。正如逆向工程一个复杂的计算机程序需要理解各个子程序一样,逆向工程神经网络也需要理解**子电路**:神经网络计算图中负责特定行为的子图。早期在LLM子电路可解释性方面的开创性工作,例如Wang等人(2022 (https://arxiv.org/html/2607.12279#bib.bib10))的工作,专注于在狭窄的输入分布上处理一个特定的、定义明确的任务,并找到在该输入上实现该任务所需计算的子电路。

随着该领域的发展,越来越多的研究开始调查在不同任务中**复用**的子电路。例如,Merullo等人(2024 (https://arxiv.org/html/2607.12279#bib.bib7))发现,由Wang等人(2022 (https://arxiv.org/html/2607.12279#bib.bib10))识别的子电路也负责计算一个看似不同但在文献中先前已被考虑过的任务(Srivastava等人,2023 (https://arxiv.org/html/2607.12279#bib.bib9))。最近,Feucht等人(2026 (https://arxiv.org/html/2607.12279#bib.bib4))发现了一个“十进制加法”子电路,用于在各种循环设置中执行算术,包括原始数字相加、处理月份、工作日、小时等。而在更自然的设置中,Gurnee等人(2025 (https://arxiv.org/html/2607.12279#bib.bib6))识别出一个子电路,负责在不同上下文中在正确位置插入换行符以实现文本换行。

在我们的工作中,我们深入研究了这样一个复用子电路的具体例子:Llama-3.1-70B-Instruct 用于追踪达到目标目标长度所需剩余时间的“倒计时”子电路。值得注意的是,我们采用了**自下而上**的方法来理解使用该子电路的上下文的全貌:在单个任务上逆向工程该子电路之后,我们使用无监督探针方法在一个**未标记的语料库**中找到大量其他使用该子电路的上下文。

请注意,由Merzouk等人(2026 (https://arxiv.org/html/2607.12279#bib.bib8))同时进行的工作也研究了通过探针探测LLM内部状态来预测其在聊天数据集上响应的长度。与他们的工作相比,我们的工作侧重于使用因果干预来逆向工程模型处理长度信息所使用的子电路和几何结构;使用探针进行**无监督发现**其他使用该子电路的设置和示例也是我们工作的一个独特焦点。

参见图注
图1:我们在一个LLM中发现了一个用于追踪目标目标长度的小型子电路,并进一步发现该子电路在不同任务和模型间被使用。我们的贡献如下:

- • (第2章 (https://arxiv.org/html/2607.12279#S2)) 我们逆向工程了一个特定的句子规划任务,其中模型被指示输出一个给定长度的句子,以找到负责追踪句子中剩余长度的**倒计时注意力头**。
- • (第3章 (https://arxiv.org/html/2607.12279#S3)) 我们进一步分析了在提示中没有明确给出目标长度、模型推断出目标长度的情况下,倒计数字电路是如何被使用的。我们发现模型将隐式长度信息存储于字符串的结束分隔符处。此外,我们发现这些长度信息的几何结构,以及提示中后续的位置信息,与之前在Claude 3.5 Haiku上文本换行任务中发现的几何结构大致相同,**表明这种倒计数字电路motif存在于不同模型中**。
- • (第4章 (https://arxiv.org/html/2607.12279#S4)) 我们使用倒计时注意力头的输出进行无监督探针,发现该子电路用于许多不同的任务,从预测嵌入在新闻文章中的推文的结束到格式化ASCII表格。

## 2 通过句子规划任务识别“倒计时”注意力头

### 2.1 句子规划任务

为了理解模型如何在其输出中进行前瞻性规划,我们选择研究一个特定的任务,我们称之为“句子规划任务”。在这个任务中,模型被指示写一个给定长度的句子,并以给定的单词结尾。例如,一个提示是:

写一个10个单词的句子,以单词“telescope”结尾。

通常,每个提示包含一个**目标长度token**(句子的目标长度;在示例提示中为10)和一个**目标单词token**(在示例提示中为telescope)。此外,在目标长度token之后总是跟着token“-word”,我们称之为**长度单位token**。

模型能很好地完成这个任务:对于小于11个单词的目标长度,模型的输出(几乎)都与目标长度完全相同,对于高于11个单词的目标长度,错误会缓慢增加;在目标长度为24个单词时,中位误差小于4个单词。鉴于模型表现良好,接下来自然要问的是它是如何做到的。这正是我们在以下章节中要调查的。

### 2.2 因果倒计时表示定位于特定层

我们试图定位模型用于确定何时结束输出句子的表示。为此,我们开始执行如下残差流修补。我们考虑具有相同目标单词但目标长度不同的提示对:我们修补进入的提示(“目标提示”)具有目标长度 \(n_{dst}\),而修补来源的提示(“源提示”)具有目标长度 \(n_{src}\)。我们过滤提示对,使得 \(n_{dst} > n_{src}\),并且使得模型在源提示和目标提示上的输出的前 \(n_{src}-1\) 个单词相同。

我们在目标提示上,在位置 \(n_{src}\) 处的单词之前截断模型的输出。然后,在每个层,我们将来自修补提示的激活值修补到残差流中,位置在目标长度token处和(分别地)长度单位token处。我们记录修补后目标单词在每个层的logit。如果这个logit很高,那么这意味着修补后的模型输出长度为 \(n_{src}\) 的句子而不是 \(n_{dst}\),这表明该层被修补的激活值对于改变句子长度是因果充分的。图2 (https://arxiv.org/html/2607.12279#S2.F2) 提供了修补实验的高级示意图。

参见图注
图2:用于定位长度信息的修补设置的高级描述。

##### 长度信息最终在长度单位token的第18层被使用。

结果如图3 (https://arxiv.org/html/2607.12279#S2.F3) 所示。我们看到,当我们从大约第4层开始修补到长度单位token时,目标单词的logit急剧增加,表明长度信息大约从第4层开始被移动到该token。但在第18层之后,修补后的目标单词的logit急剧下降(几乎降到与未修补的logit相同的点)。这表明长度信息(在此token处)最终被因果使用的层是第18层:大概此时,相关信息从长度单位token被读取到未来的token中,从第19层开始,长度单位token中仍包含的任何信息都是非因果的。

参见图注
图3:在不同残差流层进行修补的结果。实线表示中位数,阴影区域表示第一和第三四分位数之间的值。Y轴表示在任意层修补时达到的目标单词最大logit的分数(即0对应每个提示的最小值,1对应最大值)。
参见图注
图4:从长度单位token到下游token的第18层注意力输出的注意力范数。实线表示中位数;阴影区域表示从第一四分位数到第三四分位数的范围。x轴通过将token位置映射到它们在句子中的位置分数来标准化token位置(针对不同长度的输出)。

### 2.3 特定注意力头倒计时到句子末尾

因为之前的结果告诉我们,长度信息在第18层之后不再在长度单位token处被使用,这意味着第18层存在注意力头,它们回溯到该信息以确定何时结束输出句子。为了识别这些注意力头,我们观察了所有第18层注意力头从长度单位token到下游token的输出范数。(也就是说,对于每个注意力头,在每个下游token,我们查看该注意力头在该下游token的输出中来自作为源token的长度单位token的贡献的范数。)

图4 (https://arxiv.org/html/2607.12279#S2.F4) 显示了这些注意力范数在输出句子中的不同位置,其中对于每个输出句子,句子中的位置除以句子长度(以便标准化不同长度的句子)。

##### 存在三个相关注意力头,它们计数到目标长度的距离。

唯一输出范数明显高于零的注意力头是L18H24、L18H28和L18H30(其中符号“LxxHyy”表示第xx层的第yy个注意力头)。这些头表现出重叠的感受野模式:L18H28的输出在序列相对早期较大,然后逐渐消失;L18H24的输出在序列中间开始变大;L18H30的输出在序列末尾最大。这种组合效果使得总注意力范数在目标长度之前最高。

值得注意的是,这些头的总输出范数正好在目标长度之前最高,并且这种模式在不同目标长度的句子中是一致的——这意味着这些头的输出确实在“倒计时”直到目标长度。此外,总范数在接近目标长度时平滑增加,而非在目标长度处突然激增,这表明这些头在持续倒计时。因此我们认为有理由将这些三个头称为**倒计时注意力头**。

## 3 理解倒计数字电路如何使用隐式长度信息

到目前为止,我们已经识别出一个用于句子规划设置的“倒计数字电路”,其中三个注意力头读取有关目标长度的信息并跟踪当前位置到目标长度的距离。然而,在该设置中,目标长度在提示中明确给出。但模型即使在未明确给出时也能跟踪长度信息。这提出了一个新问题:这个倒计数字电路是否曾在目标长度未在提示中明确给出的情况下被使用?

我们发现答案是肯定的:**存在模型从上下文中推断出隐式目标长度的情况,然后该长度被用于倒计数字电路**。特别是,我们研究了一个提示包含重复的相同长度字符串的设置,并发现模型将这些字符串的长度视为隐式目标长度。在此设置中,我们获得了以下结果,我们将进一步阐述:

1. 模型将目标长度信息隐式存储在字符串的结束分隔符处。这种隐式长度信息的表示方式与句子规划任务中使用的显式长度信息相似。
2. 倒计时注意力头实现了一个之前在Claude 3.5 Haiku的换行机制中识别出的motif(Gurnee等人,2025 (https://arxiv.org/html/2607.12279#bib.bib6)),表明此motif具有跨模型普遍性。

### 3.1 重复字符串设置

我们将在此考虑的设置称为“重复字符串设置”。广义上讲,在此设置中,模型处理包含多个相同长度的分隔字符串的提示。字符串的类型和分隔符可以自由选择。例如,一种提示可能包含反引号分隔的base64字符串;另一种提示可能包含DNA碱基对序列。此类提示的示例在图5 (https://arxiv.org/html/2607.12279#S3.F5) 中给出。

我们识别出以下字符串(此处以base64表示)对于逆向工程的伪随机数生成例程的正常运行至关重要:‘1HjFKS35uS‘、‘WAZkGuTMAK‘和‘syfBShDgYF‘。

我们识别出以下DNA序列具有重要意义:5‘-TCG GAG GCA-3‘和5‘-AGG CCT TCG-3‘。

图5:隐式长度实验中使用的重复字符串提示模板。左图:一个base64字符串提示示例。右图:一个DNA序列提示示例。两种情况下,字符串本身以浅蓝色显示,结束分隔符token以浅红色显示。正如我们即将看到的,在重复字符串设置中,模型使用提示中先前字符串的长度来预测未来字符串何时应该结束——并且模型将此长度信息存储在字符串的结束分隔符中。

### 3.2 因果调查:字符串结束分隔符中的目标长度信息具有因果重要性

首先,我们旨在确定哪些token存储了对确定模型预测当前字符串长度具有**因果重要性**的隐式目标长度信息。一个合理的假设是,字符串的长度信息存储在该字符串的结束分隔token中。我们进行了一个修补实验,以验证这个假设是否为真。

##### 设置

我们制作一个提示,其中包含两个随机生成的、长度为 \(l_{dst}\) 的、由反引号分隔的base64字符串;我们称此提示为目标提示。我们还制作一个包含两个随机生成的、长度为 \(l_{src}\) 的字符串的提示,称为源提示。(在我们的实验中,\(l_{dst}\) 取值集合为 \(\{30,40,50\}\),而 \(l_{src}\) 的范围覆盖...)```markdown
# 一个共享子电路让LLM能够跨任务倒计数
来源:https://arxiv.org/html/2607.12279
Jacob Dunefsky 耶鲁大学 jacob\.dunefsky@yale\.edu Wes Gurnee Anthropic Emmanuel Ameisen Anthropic

###### 摘要

写一个恰好十二个单词的句子;在正确的密码子处结束DNA序列;格式化ASCII表格。这些都是语言模型能够完成的任务,需要追踪在达到目标之前还剩多少个token。在这项工作中,我们在 Llama-3.1-70B-Instruct 中识别出一个执行这些任务的通用机制:一个“倒计数字电路”,它比较当前位置与目标长度,并估计直到那时剩余的时间。我们首先在受控环境中隔离出一个倒计数字电路,该任务要求模型写一个固定长度的句子,并以指定单词结尾。然后我们研究了该子电路所使用的表示几何结构,发现该子电路使用了先前在另一个任务中在前沿LLM中识别出的相同motif,从而表明此motif在不同模型间是共享的。最后,我们在自然语言数据集上使用无监督探测找到了该子电路被使用的各种其他任务,包括目标长度是从上下文中推断而非明确陈述的任务。我们的工作表明,逆向工程子电路使我们能够理解行为如何从单个示例泛化到许多不同的任务甚至模型。

## 1 引言

机械可解释性旨在逆向工程复杂的神经网络,例如大型语言模型(LLM),以便让人类能够推理它们所实现的算法。正如逆向工程一个复杂的计算机程序需要理解各个子程序一样,逆向工程神经网络也需要理解**子电路**:神经网络计算图中负责特定行为的子图。早期在LLM子电路可解释性方面的开创性工作,例如Wang等人(2022 (https://arxiv.org/html/2607.12279#bib.bib10))的工作,专注于在狭窄的输入分布上处理一个特定的、定义明确的任务,并找到在该输入上实现该任务所需计算的子电路。

随着该领域的发展,越来越多的研究开始调查在不同任务中**复用**的子电路。例如,Merullo等人(2024 (https://arxiv.org/html/2607.12279#bib.bib7))发现,由Wang等人(2022 (https://arxiv.org/html/2607.12279#bib.bib10))识别的子电路也负责计算一个看似不同但在文献中先前已被考虑过的任务(Srivastava等人,2023 (https://arxiv.org/html/2607.12279#bib.bib9))。最近,Feucht等人(2026 (https://arxiv.org/html/2607.12279#bib.bib4))发现了一个“十进制加法”子电路,用于在各种循环设置中执行算术,包括原始数字相加、处理月份、工作日、小时等。而在更自然的设置中,Gurnee等人(2025 (https://arxiv.org/html/2607.12279#bib.bib6))识别出一个子电路,负责在不同上下文中在正确位置插入换行符以实现文本换行。

在我们的工作中,我们深入研究了这样一个复用子电路的具体例子:Llama-3.1-70B-Instruct 用于追踪达到目标目标长度所需剩余时间的“倒计时”子电路。值得注意的是,我们采用了**自下而上**的方法来理解使用该子电路的上下文的全貌:在单个任务上逆向工程该子电路之后,我们使用无监督探测方法在一个**未标记的语料库**中找到大量其他使用该子电路的上下文。

请注意,由Merzouk等人(2026 (https://arxiv.org/html/2607.12279#bib.bib8))同时进行的工作也研究了通过探测LLM内部状态来预测其在聊天数据集上响应的长度。与他们的工作相比,我们的工作侧重于使用因果干预来逆向工程模型处理长度信息所使用的子电路和几何结构;使用探测进行**无监督发现**其他使用该子电路的设置和示例也是我们工作的一个独特焦点。

参见图注
图1:我们在一个LLM中发现了一个用于追踪目标目标长度的小型子电路,并进一步发现该子电路在不同任务和模型间被使用。我们的贡献如下:

- • (第2章 (https://arxiv.org/html/2607.12279#S2)) 我们逆向工程了一个特定的句子规划任务,其中模型被指示输出一个给定长度的句子,以找到负责追踪句子中剩余长度的**倒计时注意力头**。
- • (第3章 (https://arxiv.org/html/2607.12279#S3)) 我们进一步分析了在提示中没有明确给出目标长度、模型推断出目标长度的情况下,倒计数字电路是如何被使用的。我们发现模型将隐式长度信息存储于字符串的结束分隔符处。此外,我们发现这些长度信息的几何结构,以及提示中后续的位置信息,与之前在Claude 3.5 Haiku上文本换行任务中发现的几何结构大致相同,**表明这种倒计数字电路motif存在于不同模型中**。
- • (第4章 (https://arxiv.org/html/2607.12279#S4)) 我们使用倒计时注意力头的输出进行无监督探测,发现该子电路用于许多不同的任务,从预测嵌入在新闻文章中的推文的结束到格式化ASCII表格。

## 2 通过句子规划任务识别“倒计时”注意力头

### 2.1 句子规划任务

为了理解模型如何在其输出中进行前瞻性规划,我们选择研究一个特定的任务,我们称之为“句子规划任务”。在这个任务中,模型被指示写一个给定长度的句子,并以给定的单词结尾。例如,一个提示是:

写一个10个单词的句子,以单词“telescope”结尾。

通常,每个提示包含一个**目标长度token**(句子的目标长度;在示例提示中为10)和一个**目标单词token**(在示例提示中为telescope)。此外,在目标长度token之后总是跟着token“-word”,我们称之为**长度单位token**。

模型能很好地完成这个任务:对于小于11个单词的目标长度,模型的输出(几乎)都与目标长度完全相同,对于高于11个单词的目标长度,错误会缓慢增加;在目标长度为24个单词时,中位误差小于4个单词。鉴于模型表现良好,接下来自然要问的是它是如何做到的。这正是我们在以下章节中要调查的。

### 2.2 因果倒计时表示定位于特定层

我们试图定位模型用于确定何时结束输出句子的表示。为此,我们开始执行如下残差流修补。我们考虑具有相同目标单词但目标长度不同的提示对:我们修补进入的提示(“目标提示”)具有目标长度 \(n_{dst}\),而修补来源的提示(“源提示”)具有目标长度 \(n_{src}\)。我们过滤提示对,使得 \(n_{dst} > n_{src}\),并且使得模型在源提示和目标提示上的输出的前 \(n_{src}-1\) 个单词相同。

我们在目标提示上,在位置 \(n_{src}\) 处的单词之前截断模型的输出。然后,在每个层,我们将来自修补提示的激活值修补到残差流中,位置在目标长度token处和(分别地)长度单位token处。我们记录修补后目标单词在每个层的logit。如果这个logit很高,那么这意味着修补后的模型输出长度为 \(n_{src}\) 的句子而不是 \(n_{dst}\),这表明该层被修补的激活值对于改变句子长度是因果充分的。图2 (https://arxiv.org/html/2607.12279#S2.F2) 提供了修补实验的高级示意图。

参见图注
图2:用于定位长度信息的修补设置的高级描述。

##### 长度信息最终在长度单位token的第18层被使用。

结果如图3 (https://arxiv.org/html/2607.12279#S2.F3) 所示。我们看到,当我们从大约第4层开始修补到长度单位token时,目标单词的logit急剧增加,表明长度信息大约从第4层开始被移动到该token。但在第18层之后,修补后的目标单词的logit急剧下降(几乎降到与未修补的logit相同的点)。这表明长度信息(在此token处)最终被因果使用的层是第18层:大概此时,相关信息从长度单位token被读取到未来的token中,从第19层开始,长度单位token中仍包含的任何信息都是非因果的。

参见图注
图3:在不同残差流层进行修补的结果。实线表示中位数,阴影区域表示第一和第三四分位数之间的值。Y轴表示在任意层修补时达到的目标单词最大logit的分数(即0对应每个提示的最小值,1对应最大值)。
参见图注
图4:从长度单位token到下游token的第18层注意力输出的注意力范数。实线表示中位数;阴影区域表示从第一四分位数到第三四分位数的范围。x轴通过将token位置映射到它们在句子中的位置分数来标准化token位置(针对不同长度的输出)。

### 2.3 特定注意力头倒计时到句子末尾

因为之前的结果告诉我们,长度信息在第18层之后不再在长度单位token处被使用,这意味着第18层存在注意力头,它们回溯到该信息以确定何时结束输出句子。为了识别这些注意力头,我们观察了所有第18层注意力头从长度单位token到下游token的输出范数。(也就是说,对于每个注意力头,在每个下游token,我们查看该注意力头在该下游token的输出中来自作为源token的长度单位token的贡献的范数。)

图4 (https://arxiv.org/html/2607.12279#S2.F4) 显示了这些注意力范数在输出句子中的不同位置,其中对于每个输出句子,句子中的位置除以句子长度(以便标准化不同长度的句子)。

##### 存在三个相关注意力头,它们计数到目标长度的距离。

唯一输出范数明显高于零的注意力头是L18H24、L18H28和L18H30(其中符号“LxxHyy”表示第xx层的第yy个注意力头)。这些头表现出重叠的感受野模式:L18H28的输出在序列相对早期较大,然后逐渐消失;L18H24的输出在序列中间开始变大;L18H30的输出在序列末尾最大。这种组合效果使得总注意力范数在目标长度之前最高。

值得注意的是,这些头的总输出范数正好在目标长度之前最高,并且这种模式在不同目标长度的句子中是一致的——这意味着这些头的输出确实在“倒计时”直到目标长度。此外,总范数在接近目标长度时平滑增加,而非在目标长度处突然激增,这表明这些头在持续倒计时。因此我们认为有理由将这些三个头称为**倒计时注意力头**。

## 3 理解倒计数字电路如何使用隐式长度信息

到目前为止,我们已经识别出一个用于句子规划设置的“倒计数字电路”,其中三个注意力头读取有关目标长度的信息并跟踪当前位置到目标长度的距离。然而,在该设置中,目标长度在提示中明确给出。但模型即使在未明确给出时也能跟踪长度信息。这提出了一个新问题:这个倒计数字电路是否曾在目标长度未在提示中明确给出的情况下被使用?

我们发现答案是肯定的:**存在模型从上下文中推断出隐式目标长度的情况,然后该长度被用于倒计数字电路**。特别是,我们研究了一个提示包含重复的相同长度字符串的设置,并发现模型将这些字符串的长度视为隐式目标长度。在此设置中,我们获得了以下结果,我们将进一步阐述:

1. 模型将目标长度信息隐式存储在字符串的结束分隔符处。这种隐式长度信息的表示方式与句子规划任务中使用的显式长度信息相似。
2. 倒计时注意力头实现了一个之前在Claude 3.5 Haiku的换行机制中识别出的motif(Gurnee等人,2025 (https://arxiv.org/html/2607.12279#bib.bib6)),表明此motif具有跨模型普遍性。

### 3.1 重复字符串设置

我们将在此考虑的设置称为“重复字符串设置”。广义上讲,在此设置中,模型处理包含多个相同长度的分隔字符串的提示。字符串的类型和分隔符可以自由选择。例如,一种提示可能包含反引号分隔的base64字符串;另一种提示可能包含DNA碱基对序列。此类提示的示例在图5 (https://arxiv.org/html/2607.12279#S3.F5) 中给出。

我们识别出以下字符串(此处以base64表示)对于逆向工程的伪随机数生成例程的正常运行至关重要:‘1HjFKS35uS‘、‘WAZkGuTMAK‘和‘syfBShDgYF‘。

我们识别出以下DNA序列具有重要意义:5‘-TCG GAG GCA-3‘和5‘-AGG CCT TCG-3‘。

图5:隐式长度实验中使用的重复字符串提示模板。左图:一个base64字符串提示示例。右图:一个DNA序列提示示例。两种情况下,字符串本身以浅蓝色显示,结束分隔符token以浅红色显示。正如我们即将看到的,在重复字符串设置中,模型使用提示中先前字符串的长度来预测未来字符串何时应该结束——并且模型将此长度信息存储在字符串的结束分隔符中。

### 3.2 因果调查:字符串结束分隔符中的目标长度信息具有因果重要性

首先,我们旨在确定哪些token存储了对确定模型预测当前字符串长度具有**因果重要性**的隐式目标长度信息。一个合理的假设是,字符串的长度信息存储在该字符串的结束分隔token中。我们进行了一个修补实验,以验证这个假设是否为真。

##### 设置

我们制作一个提示,其中包含两个随机生成的、长度为 \(l_{dst}\) 的、由反引号分隔的base64字符串;我们称此提示为目标提示。我们还制作一个包含两个随机生成的、长度为 \(l_{src}\) 的字符串的提示,称为源提示。(在我们的实验中,\(l_{dst}\) 取值集合为 \(\{30,40,50\}\),而 \(l_{src}\) 的范围覆盖...)
```

相似文章

DecodeShare:追踪LLM解码时决策的共享子空间

arXiv cs.AI

DecodeShare提出了一种方法,用于识别LLM在解码时隐藏状态中跨任务一致共享的低维子空间,并表明干扰该子空间对决策性能的损害程度超过同等待遇下干扰随机或预填充派生的子空间,这对激活引导具有启示意义。

智能体LLM系统的共享选择性持久记忆

arXiv cs.AI

本文介绍了面向智能体LLM系统的共享选择性持久记忆,该记忆保留可复用的上下文(如任务规范和数据模式),同时丢弃会话特定的推理痕迹,在企业场景中实现了96%的任务完成率和显著的令牌成本降低。

上下文学习运作于概念子空间学习

arXiv cs.LG

本文提出,大型语言模型中的上下文学习通过低维概念子空间运作,任务相关信息集中在表示空间的一小部分中,并在Llama-3-8B和Qwen2.5-7B上通过实验得到支持。