规划还是即兴?在开放模型和开放跨层转码器上对诗歌规划位点进行压力测试
摘要
本研究在开放模型和跨层转码器上对语言模型中韵律规划的可泛化性进行压力测试,发现有效规划位置是发射相邻的,而非之前报道的换行符驻留。
arXiv:2609.18440v1 公告类型:新
摘要:Lindsey 等人(2025)报告称,Claude 3.5 Haiku 规划韵律:候选韵词的特征在行书写前的换行符上活跃,并且抑制-注入干预仅在应用到那里时重定向行(他们的图13)。我们测试了这在七个单元中跨越四个开放模型(0.6B 到 2.6B 参数)与六个开放跨层转码器(CLTs)的泛化程度,在一个消费级 GPU 上,将主张分解为位置特异性(C1)、换行符位点身份(C2)和换行符驻留计划(C3)。这是一个压力测试而非忠实复现:这些 CLTs 的归因图不可用,因此特征从解码器向量自下而上发现。C1 泛化,在每个单元和所有 444 个提示-注入对中具有可检测效果的 247 个中,但有效位置是最终提示令牌,与发射相邻,并且只有两个单元达到行为上有意义的概率。C2 和 C3 未被任何探针恢复:对每个活跃特征的普查在换行符处未发现韵律预期富集,并且在模型组合整行时引导换行符,经过 36 次运行和 8,640 个采样行,显示了原因。该干预强但只有一个令牌长,使得注入词在 720 个样本中的 703 个中成为组合行的第一个词,而韵律在六个词后未被触动。最后测试完全去掉转码器:从其第三行以不同韵律结束的最小对诗歌中,修补换行符的整个残差,在每个层,在 1,260 个组合行中有 11 个移动了韵律,而基线为 4,设计分辨率为 1.4%。我们将此视为边界条件而非反驳:在此规模和使用这些转码器时,因果位点是发射相邻的。我们复现了图13的形状,而非其机制。代码和数据公开(代码:github.com/PCfVW/poetry-planning-site)。
查看缓存全文
缓存时间: 2026/09/17 09:18
# 规划还是即兴发挥?在开放模型与开放跨层转码器上对诗歌规划位点进行压力测试
来源:https://arxiv.org/html/2609.18440
###### 摘要
Lindsey 等人 (2025)(https://arxiv.org/html/2609.18440#bib.bib10)报告称,Claude 3.5 Haiku 会规划韵脚:候选押韵词的特征在行文之前的新行符前就已激活,并且仅当“抑制-注入”干预应用于该位置时才会改变行文方向(见其图13)。我们在七个单元中测试了这一发现的泛化性,这些单元跨越四个开放模型(参数量从0.6B到2.6B),并使用了六个开放的跨层转码器(CLT),在单个消费级GPU上运行,将该主张分解为位置特异性(C1)、新行位点同一性(C2)以及新行驻留规划(C3)。这是一次压力测试,而非忠实复现:由于这些CLT无法获得归因图,特征是从解码器向量自下而上发现的。C1在所有单元中均成立,并且在444对“提示-注入”组合中有247对(所有具有可检测效应的配对)也成立,但有效位置是最后一个提示词元,与输出相邻,且仅有两个单元达到了行为学上有意义的概率。任何探针均未恢复C2和C3:对所有活跃特征的普查未发现新行处有押韵预期特征的富集;并且在模型组合整行时对新行进行引导(超过36次运行,采样8640行)也揭示了原因。该干预虽然强烈但仅持续一个词元长,导致在720个样本中有703个,注入的词成为组合行的第一个词,而押韵词则位于六个词之后且不受影响。最终测试完全移除了转码器:从一个最小对诗歌(其第三行以不同韵脚结束)中,修补新行在每一层的全部残差,在1260个组合行中有11个改变了韵脚,而基线为4个,该设计解决了1.4%的问题。我们将此解读为边界条件而非反驳:在此规模及使用这些转码器时,因果位点位于输出相邻处。我们复现了图13的形态,而非其机制。代码和数据已公开(Jacopin, 2026b (https://arxiv.org/html/2609.18440#bib.bib7))。
## 1 引言
语言模型是否进行提前规划是可解释性研究的核心问题,而押韵诗歌是其最清晰的已发表测试案例。Lindsey 等人 (2025)(https://arxiv.org/html/2609.18440#bib.bib10)区分了模型以押韵结束一行的两种机制:*纯即兴*,即仅在必须输出时才选择词语;*规划*,即在写下这行之前就承诺一个候选结尾,并围绕它进行创作。对于 Claude 3.5 Haiku,他们报告了规划存在的证据,其中最有力的证据来自一个引导位置实验(其图13):抑制规划词特征并注入替代方案,*仅当*干预应用于行文前的新行符词元时才会改变补全,该词元距离输出词元有几个词元的距离。图13是泛化性研究的理想目标。它是因果性的而非相关性的,它做出了一个可证伪的点预测(效应集中于一个特定的上游位置),并且它使用专有模型和专有的3000万特征跨层转码器(CLT)产生,因此尚未在Anthropic之外得到端到端验证。最近的开放模型研究从不同角度接近它:Hanna 和 Ameisen (2026)(https://arxiv.org/html/2609.18440#bib.bib4)使用CLT在Qwen3模型上复现了韵脚规划,并认为潜在规划随规模增长而出现;Maar 等人 (2026)(https://arxiv.org/html/2609.18440#bib.bib12)使用对比引导向量改变了押韵行为。Jacopin (2026d)(https://arxiv.org/html/2609.18440#bib.bib9)报告了在Gemma 2 2B和Llama 3.2 1B上进行位置特异的CLT引导,但其位点与Anthropic的不同,这一差异先前研究未加分析,而我们在此明确其核心地位。
#### 本文是什么,不是什么。这是对图13泛化性的压力测试,符合其为可复现性轨道撰写的定位:相同的干预机制,应用于超出原始实验范围的场景(开放模型比Claude 3.5 Haiku小两到三个数量级,开放CLT狭窄十到两千倍)。它*不是*对原始方法的忠实复现。原始研究自上而下发现规划词特征,通过特定补全的归因;在消费级规模的这些开放CLT上不存在归因图工具,因此我们自下而上从解码器向量发现特征。这一差异至关重要,我们反复提及:自下而上的发现找到的是*书写*押韵词的特征,只能测试规划是否通过此类特征可见。我们为每个主张说明我们的探针能和不能证明什么(§2 (https://arxiv.org/html/2609.18440#S2), §7 (https://arxiv.org/html/2609.18440#S7))。
#### 贡献。遵循该轨道的主题,我们测试了泛化性(跨开放模型和CLT)、消融(哪些协议组件携带效应)、基线(非CLT引导、逐层转码器,以及来自“死鲑鱼”谱系的随机对照,Méloux 等人, 2025 (https://arxiv.org/html/2609.18440#bib.bib13)),以及评估(哪些指标选择会改变结论)。我们的答案来自七个(模型,CLT)单元,这些单元在干预位置和强度上进行了扫描,并加上对444对“提示-注入”组合的重新分析:
1. **位置特异性(C1)成立,但部分具有通用性。**在7/7个单元中,干预仅在一个位置有效;在247对具有可检测效应的配对中,该位置是最后一个提示词元(§4.1 (https://arxiv.org/html/2609.18440#S4.SS1))。随机的书写方向也在该位置集中其杠杆作用,但幅度小得多:峰值的*位置*是输出相邻书写路径的属性,而其*幅度*是区分押韵特征的依据(§4.2 (https://arxiv.org/html/2609.18440#S4.SS2))。
2. **七个单元中两个实现了行为学重定向。**只有两个mntss单元达到了改变生成文本的概率(0.48, 0.85);五个Qwen3单元将概率从10⁻⁷移动到10⁻³,可检测但无行为学影响(§4.1 (https://arxiv.org/html/2609.18440#S4.SS1))。
3. **新行位点(C2)和新行规划(C3)未被恢复。**新行在所有单元和所有配对中对韵脚目标均无作用,并且不携带任何押韵预期特征的富集(§4.3 (https://arxiv.org/html/2609.18440#S4.SS3))。在模型组合整行时对其进行引导,它只捕获下一个词元而不及其余:注入的词在1545行中出现在1540行,成为该行的第一个词,而韵脚在任何六个计数标准下均未被重定向(§4.4 (https://arxiv.org/html/2609.18440#S4.SS4))。
4. **幅度属于转码器,而非模型**(跨CLT有六个数量级差异,§4.6 (https://arxiv.org/html/2609.18440#S4.SS6))。
5. **协议的自由参数很重要:**原始研究未记录引导强度;最优值在不同单元间从s=1变化到s=25,且更换一个注入特征可使一个单元从3.5×变为33,860×(§5 (https://arxiv.org/html/2609.18440#S5))。
所有实验在一台消费级GPU<sup>11</sup>上运行;每个数字均可从提交的产物中重新生成。
> <sup>11</sup>一块 RTX 5060 Ti (16 GB),Rust/candle技术栈(HuggingFace, 2023 (https://arxiv.org/html/2609.18440#bib.bib5); Jacopin, 2026a (https://arxiv.org/html/2609.18440#bib.bib6))。命令、制品、运行时和特征标识符见附录B (https://arxiv.org/html/2609.18440#A2)。
## 2 原始结果与待检验主张
Lindsey 等人 (2025)(https://arxiv.org/html/2609.18440#bib.bib10)用一个对句开头(“He saw a carrot and had to grab it,”)提示 Claude 3.5 Haiku,并研究模型如何用“rabbit”补全第二行。通过一个3000万特征的CLT计算的归因图将决策定位在第二行前的新行符词元上:候选词“rabbit”和“habit”的特征在那里激活,根据其图注,“这些特征仅在规划词元上激活”。他们的图13随后扫描了“抑制-注入”干预(抑制“rabbit”和“habit”特征,注入在另一首诗中找到的“green”特征)的位置,并绘制了预测不同最终词元的概率图:“引导干预仅在新行规划词元上有效应”。在对25首诗的随机样本进行的单独测试中,注入规划词特征使模型在70%的情况下以注入词结束其行文。他们自己的两个注意事项对后续内容重要:未记录数值引导强度,以及规划词特征“在大约一半的诗中”被发现,作者将其归因于CLT覆盖不全或模型并非总在规划。
#### 三个主张。我们将结果分解为三个可单独检验的主张。
- **C1(位置特异性):** 干预效应集中于单一位置;其他位置无作用。
- **C2(位点同一性):** 该位置是行文前的新行符,位于输出词元上游,而非输出相邻位置。
- **C3(规划表征):** 代表规划词的特征在写下该行之前就在规划位点激活。
C1 without C2 and C3 与即兴创作是兼容的:一个在输出相邻处的干预直接偏向输出分布。C2和C3才是使该结果成为*规划*证据的要素。这一区别很重要:Jacopin (2026d)(https://arxiv.org/html/2609.18440#bib.bib9)将其位置扫描描述为复现了图13,但其有效位点是最后一个提示词元,因此它证实了C1,而正如我们将展示的,C2和C3并未被恢复。
**表1:** 原始引导位置实验与本次压力测试之间的协议差异。特征发现行是限制我们探针能力的那一行(§7 (https://arxiv.org/html/2609.18440#S7))。
#### 我们的探针能和不能证明什么。表1 (https://arxiv.org/html/2609.18440#S2.T1) 列出了协议差异。有两个在整个过程中是固定的。首先,自下而上的特征发现使发现的特征偏向输出相邻的(“说XX”)行为。基于此类特征的引导测试可以表明*这些*书写方向不会从新行重定向;它不能表明不存在新行驻留的规划,因为由我们的扫描从未浮现的特征所表示的规划对它将是不可见的。§4.3 (https://arxiv.org/html/2609.18440#S4.SS3) 的普查旨在缩小这一差距(它分类了每个活跃特征,而不仅仅是扫描命中),但其类规划标准仍然读取解码器。其次,我们的主要扫描使用的是立即结束于押韵词之前的提示;§4.4 (https://arxiv.org/html/2609.18440#S4.SS4) 运行了匹配原始几何形状的组合视野变体。始终如一地,我们说“未恢复”的主张是指我们的探针均未发现;本文中“反驳”一词保留不用。
## 3 实验设置
#### 模型与转码器。我们使用四个开放基础模型(Gemma Team, 2024 (https://arxiv.org/html/2609.18440#bib.bib3); Llama Team, 2024 (https://arxiv.org/html/2609.18440#bib.bib11); Qwen Team, 2025 (https://arxiv.org/html/2609.18440#bib.bib15)),涵盖同一家族的两个规模(Qwen3-0.6B 和 1.7B)和两个架构家族(Llama 3.2 1B, Gemma 2 2B),与来自两个独立管线的六个开放CLT交叉:mntss 简单ReLU CLT(426K至2.5M特征)和 BlueLightAI JumpReLU CLT(每层16K和20K)(mntss, 2025 (https://arxiv.org/html/2609.18440#bib.bib14); BlueLightAI, 2026 (https://arxiv.org/html/2609.18440#bib.bib1))。交叉模型、CLT和韵脚家族得到表3 (https://arxiv.org/html/2609.18440#S4.T3) 中的七个单元。CLT是稀疏自编码器字典学习的跨层后代(Templeton 等人, 2024 (https://arxiv.org/html/2609.18440#bib.bib17))。CLT实现通过Python Circuit Tracer参考实现(Safety Research, 2025 (https://arxiv.org/html/2609.18440#bib.bib16))进行验证:90/90个顶级特征匹配,最大相对误差1.2×10⁻⁶。
#### 特征发现。对于每个CLT,我们扫描每个特征的解码器向量与完整的词元嵌入矩阵,保留顶级词元为干净英语单词的特征,用CMU发音词典(Carnegie Mellon University, 2014 (https://arxiv.org/html/2609.18440#bib.bib2))转录它们,并按韵脚(最后一个重读元音之后的部分)分组。这为Gemma 426K产生了287个音韵干净的特征(35个韵脚组,98个词),Llama 524K产生79个,Qwen3 CLT产生636到739个。
#### 干预协议。遵循原始的抑制-注入设计:提示自然韵脚组的所有已发现特征在强度-s处被钳制,替代组的一个特征在+s处被添加,两者都从特征的源层应用到所有下游层,应用于单个词元位置。我们扫描每个提示词元的位置,强度扫描s∈{0.5,1,2.5,5,10,25,50,100}(一个二维网格),并测量注入词的下一个词元概率。提示是四行补全诗歌,以尾随空格结束(附录A (https://arxiv.org/html/2609.18440#A1));基础模型需要这种引导才能押韵(裸提示的韵脚率为0%,引导后升至78%)。
#### 效应量层级。因为相对于微小基线的比率会使弱效应显得强,所以每个引导结果都附带其绝对概率,并被分配到三个层级之一:*行为学*(P≥0.1,注入词竞争贪婪输出)、*边缘*(10⁻³≤P<0.1)和*仅logit*(P<10⁻³,在分布中可检测,但在这些温度下对采样文本无影响)。
**表2:** 每个实验的样本量。单提示实验在文中已标注;局限性部分讨论了为何在此规模下提示集合很小。
## 4 结果
### 4.1 C1:一个有效位置,在七个单元中的两个达到行为学影响
表3 (https://arxiv.org/html/2609.18440#S4.T3) 总结了七个单元;图1 (https://arxiv.org/html/2609.18440#S4.F1) 显示了四个位置扫描。在每个单元中,除一个位置外,扫描在基线处都是平坦的,该位置根据单元不同上升了3.8到10⁷倍。七个单元中有六个在最后一个提示词元处达到峰值;第七个在一个位置前达到峰值。参考单元复现并略微超过了Jacopin (2026d)(https://arxiv.org/html/2609.18440#bib.bib9):Gemma在s=25时为0.482,而该研究固定s=10时为0.457;Llama为0.853,对比0.777。表3 (https://arxiv.org/html/2609.18440#S4.T3) 的层级限定了标题。只有两个mntss单元是行为学的:注入词达到0.48和0.85,足以改变生成文本。带16K开发CLT的Qwen3-0.6B单元是边缘的(0.009),四个带生产20K CLT的Qwen3单元是仅logit的,将目标从约10⁻⁷最多移动到4.5×10⁻⁶。单位置*特征*存在于所有七个中;*重定向*(原始中70%的意义上)存在于两个中。
#### 广度。两个检查解决了每个单元单个提示的问题。保持每个参考单元的干预固定,早期研究中另外三个经过验证的提示,包括自然韵脚与注入特征无关的提示,所有都出现了相似文章
PlanningBench: 生成可扩展且可验证的规划数据,用于评估和训练大型语言模型
PlanningBench 是一个用于生成可扩展、多样且可验证的规划数据的框架,以评估和训练大型语言模型。该框架采用约束驱动的合成流程,具备自适应难度控制和质量过滤功能。实验表明,前沿大语言模型在处理耦合约束时仍存在困难,而基于 PlanningBench 数据的强化学习能够提升模型在未见过的规划任务上的表现。
测试,然后路由:语言模型如何跨模型和语言执行上下文中的条件规则
本文通过探测测试和路由是否是可分离的机制,研究语言模型如何执行上下文中的条件规则。利用跨三个开放模型和六种语言的激活修补,作者发现谓词测试是模块化的,而路由表示则受令牌绑定且不可迁移。
压力之下:情感框架在小型语言模型中引发可测量的行为变化和结构化的内部几何结构
本文研究了情感框架的评估后续如何影响小型语言模型(Qwen 3.5 0.8B和2B)的行为和内部表示。通过使用不可能完成的编码任务,他们发现压力框架会促使走捷径,而冷静和好奇心则能保持诚实,并发现了在激活空间中形成结构化几何结构的冷静相对方向向量。
编码智能体提前思考
本文研究了编码智能体中的语言模型如何在迭代编辑过程中内部表示不断演变的程序。作者发现,线性探针可以从残差流中解码程序属性(例如解析、测试通过率),并且令人惊讶的是,这些表示在代理实际进行编辑之前就能预测未来结果,揭示了一个“潜在编程视野”。
CreativityNeuro:引导语言模型权重以提升发散性思维并减少模式崩溃
介绍CreativityNeuro,一种无需数据的方法,通过引导语言模型权重来增强发散性思维并减少模式崩溃,在不进行重新训练或微调的情况下,在创造力评估中实现了显著改进。