中断循环:周期性主题变化提升基础语言模型的评估惊讶度与连接感
摘要
本文研究生成文本中周期性主题变化如何影响基础语言模型的评估惊讶度和连接感,发现中断能提升这些指标,但无法整合成连贯文档。
arXiv:2608.19893v1 发布类型:新
摘要:基础语言模型在没有任务时产生的新颖性从何而来,大语言模型对长序列的评判实际能看到什么?我们在三个基础模型上,通过24种条件拆解了一个受认知启发的生成循环。其效果主要集中在一个操作上:每隔几百个令牌注入一个新主题(中断)到一个字面重复被抑制(习惯化)的流中。我们仅评判生成文本的窗口,以前提为单位(n=10),并使用一个可重复性测量的评判器,与第二个评判器家族和人类读者进行对比。在该协议下,与仅习惯化相比,中断使评估的惊讶度提升1.2到1.4分,连接感提升0.8分。要求连续性的连接词有害;单纯的段落在新文本上未添加可检测的效果;重置上下文至少与保留上下文一样好;并且在新前提上的预注册复制证实了主要对比。窗口评判器未能看到的三件事改变了本研究的最初版本,我们认为它们具有普遍用途。评判器将实验者注入的句子评分为主模型自身产出。固定轮换注入句子使模型重播其超出评判器视野的早期片段,评判器将重播评分的惊讶度和连接感(在中断后窗口中占65-80%,周期为150-300)。并且局部增益无法整合:没有任何分支产生一体化文档。显著性监视器、循环内评判器、跨中断记忆和带有开放门的评判门控审查运行均无增益。在带有验证器的问题(在线装箱)上,中断将有效且不同的候选启发式方法数量增加三到四倍,但未提升最佳方法的质量。我们报告了一个用于长生成的评估协议和一个简单干预的受控特性描述,而非创造力机制。
查看缓存全文
缓存时间: 2026/08/21 10:13
# 打断循环:周期性主体变换提升基础语言模型的判断惊奇度与连接性 来源:https://arxiv.org/html/2608.19893 预印本,2026年8月20日 ###### 摘要 基础语言模型在无任务情况下产生的新颖性从何而来?大型语言模型评判器在长文本流中实际能捕捉到什么?我们在三个基础模型上对24种条件下的认知启发式生成循环进行拆解分析。其效果主要源于一个操作:每隔数百个令牌注入一个新主体(即一次*中断*),同时抑制文本流的字面重复(即*习惯化*)。我们仅评估生成文本的窗口段落,以前提语句为单位(\(n=10\)),并采用可重复性经验证的评判器,与其他评判器家族及人类读者进行对比。该方案下,中断操作使判断惊奇度提升1.2至1.4分,连接性提高0.8分。要求连续性的连接词会产生负面影响;纯段落分隔在新文本上无显著效果;重置上下文至少与保留上下文效果相当;在新前提上进行的预注册复现验证了核心对比结论。有三项窗口评判器未能察觉的因素改变了本研究的初始版本,我们认为这些发现具有普遍价值:评判器将实验者注入的句子误判为模型自身输出;固定轮换的注入句子使模型重播评判器视野之外的早期片段,评判器将重播行为误判为惊奇度与连接性(在150–300令牌周期下,65-80%的中断后窗口存在此现象);局部改进无法整合为完整文档。显著性监测器、循环内评判器、跨中断记忆以及带开启机制的评判门控审查运行均无增益。在具有验证器的问题(在线装箱问题)中,中断操作使有效且独特的候选启发式方法数量增至三到四倍,但并未提升最优方案的质量。我们提出了一种长文本生成的评估方案和对简单干预措施的受控特性分析,而非创造力机制的解释。 ## 1 引言 若要求语言模型提供新内容,通常会得到流畅、看似合理但熟悉的回答。三个常见归因点也对应三个常见优化方向。其一是*采样器*:通过核心采样、典型采样或min-p截断来约束下一个令牌分布的尾部,或通过更高温度进行探索。其二是*提示*:通过工程化输入引导模型走向非自发方向。其三是较少被提及的*循环*:当模型输出成为自身下一轮输入且无人提问时发生的过程。循环通常被认为是人类新颖性的来源。洞见很少作为陌生问题的答案出现,而是诞生于自我反馈的闭合思维回路中——在孵化期、思维漫游和睡眠期间,当自发生成的偏差通过批判性审查并被关联回原有内容时。创造认知神经科学描述了三个耦合系统:负责生成的默认模式网络、负责评估的执行控制网络,以及决定注意力分配的显著性网络。更具创造力的人前两者的耦合更强,且显著性区域首先建立耦合[2,3]。创造力本身常被定义为连接语义相距较远的概念[14],而孵化效应(搁置问题后重新审视)对问题解决有可测量的促进作用[27]。本文在控制条件下探究基础语言模型无任务时产生的新颖性来源,并验证哪些常规归因机制经得起实证检验。我们测量的结果具有特定维度,即*判断性叙事惊奇度、连接性与连贯性*——基于强制开放式续写的短窗口文本,由经重复性验证的LLM评判器阅读,并与其他评判器家族及人类读者对照。这仅是创造力的一个要素(恰到好处的意外转折),而非创造力本身。标题反映了项目初始问题;结果则回答了更具体的子问题。研究过程中,本项目部分转化为对其工具本身的研究。LLM评判器在阅读长文本流窗口时存在盲区,这些发现将改变结论,而我们必须进行的修正我们认为具有超越本文的普适价值。我们依次检验了三个方向。这是三项相关但独立的研究,使用不同生成器、任务和样本量,通过同一问题和测量理念串联。它们并非在统一条件下对采样器、提示和循环的因子分解——循环研究是本文的核心贡献,另外两项则是其动机。所有实验共享同一测量框架:本地8位运行的基础模型(范围界定见第3节);来自与生成器不同家族的LLM评判器,每个窗口采样\(k\)次取中位数;循环实验中以前提语句(而非窗口)为推断单位;若存在公开训练语料库,则计算相对于原文的新颖度。 #### 术语说明 几个重复出现的术语在此定义:*单元格*指在单一条件下运行的前提语句;*测试组*指在相同十个前提上运行的一组条件;*脚手架*指我们初始采用的完整架构(包括显著性监测器、循环内评判器、遗忘机制、重新播种、重遇机制),详见第3.3节;*阶梯*指论文反复分析的四个核心实验分支:裸生成、裸生成+习惯化、习惯化+中断、完整脚手架;*退化模式*指基础模型在强制续写下进入的重复或语料库式状态(字面循环、网站页脚、考试答案、翻译对照表等)。 #### 采样器与提示 我们构建了“创造性错误”理念的强化版本:带熵约束和连贯性底线的反概率解码器。其效果仅限于表层。四元组新奇度(相对于OLMo-2训练语料)大致翻倍,逐字训练块重复减少四倍,但在生成循环和验证搜索中,该解码器与普通采样在创意层面无显著差异。我们也尝试了远离人类提示的输入,但在所测试的操作化条件下未发现其低概率性带来任何优势。两项研究详见附录A,正是它们促使研究转向循环机制。 #### 循环 在屏蔽文本结束令牌的情况下持续生成时,基础模型会在数百个令牌内陷入退化模式并保持。脚手架可使其恢复活力。随后我们通过四组测试、24种条件拆解脚手架,发现其效果主要源于两个非复杂操作:*习惯化*(通过窗口化重复惩罚防止字面重复)和*中断*(每隔数百个令牌注入新起始句)。中断的贡献更大。接着我们探究有效中断的构成:必须引导新方向(注入前提或文本自身历史与未中断同样无效;无新主体的边界不产生可检测增益;要求连续性的边界反而有害);必须每次更新(固定四句轮换使模型重播自身早期片段,而窗口评判器无法察觉此现象);无论保留或丢弃早期文本均有效,但丢弃效果更好(部分因模型无法重播);时钟作为节拍器与显著性监测器效果相当,且150–300令牌的间隔在生成文本本身上效果最佳。我们也展示了中断的局限:作为完整文档阅读时,这些文本流均未形成整体连贯或发展的文本;中断文本流读似多次重启序列——该算子作用于窗口而非整体。在有验证器的问题中,它增加有效候选方案数量但不提升最优方案质量。阶梯模式在来自两个家族的三个生成器模型上可复现,其排序被独立人类读者重现,且在十个新前提上的预注册复现验证了核心对比结论。最后我们进行网络内部的描述性分析:13个采样层的残差流几何显示,裸生成在所有采样层移动最小;判断惊奇度与深层连续性上的表层偏离共变;而得分最高的中断操作几乎不改变深层状态。 #### 贡献 按我们当前认知的重要性排序: 1. **LLM评判器在长文本生成中的盲区**:揭示了三项影响本研究初始版本的偏差——任何采用窗口化LLM评判器的长文本评估都可能面临:评判器将实验者注入文本误判为模型输出;模型重播评判器视野外的早期片段被误判为惊奇度与连接性;局部改进无法整合为整体。同时提出修正方案:仅生成窗口、仅新文本评估、文档级判断、以前提为单位、流程测试-重测、双评判器家族验证及人类读者参与。 2. **中断操作的受控特性分析**:明确中断中携带效果的部分(新主体而非边界、非保留上下文),分析其内容、时序与周期,在来自两个家族的三个基础模型、后训练模型、未量化模型及第二体裁上的复现,以及在新前提上的预注册确认性复现。 3. **架构的负面结果及验证器初步探索**:显著性监测器作为触发器、循环内评判器、遗忘重播、跨中断记忆、带开启机制的评判门控审查运行、文档级累积——均未对最小算子产生增益。在有验证器的问题中,该算子增加有效候选方案而非最优方案质量。 4. **校准的反概率解码器**:其新奇性在表层真实存在但在创意层面不可检测;对低概率输入的零效应;以及残差流描述性分析。代码、每次运行数据、评判结果、人类评分包及实验室日志随论文同步发布。 ## 2 相关工作 #### 解码与尾部 核心采样[13]截断下一个令牌分布的不可靠尾部。局部典型采样[18]瞄准人类式的惊奇度。Min-p[21]根据模型置信度缩放截断阈值,正是我们所用的连贯性底线。对比解码[16]和即插即用引导[7]将分布向或远离参考点塑形。这些方法均调控尾部,而我们的反概率采样器则在熵约束和底线之上探索尾部,我们发现这仅获得表层新奇性。 #### 重复、自我强化与牵引效应 基础模型自发的坍缩是经典研究对象。Zhu等人(2023)[30]将其命名为*自我强化效应*(重复令牌概率随重复次数增加),并通过近期窗口内的重复惩罚抑制该效应。我们称为*习惯化*的分级窗口惩罚属于同类解码时算子,我们不主张其新颖性。Guan和Huang(2023)[10]将重复倾向归因于最大似然训练的学习偏差,并通过自对比训练修正。Xu等人(2023)[29]追踪当前与历史令牌分布距离以检测重复和主题漂移,并据此引导解码。在机制层面,Niu等人(2025)[22]证明语言模型即使面对无关令牌也会在上下文中分配更高概率(*上下文牵引效应*),并定位负责该效应的注意力头。我们的裸分支是模型自身输出上的牵引效应,而自我复制发现则是实验者注入句子上的牵引效应。本文贡献不在于重复的新补救措施,而在于测量补救措施的局限(习惯化文本虽流畅仍无创意)、第二个结构化算子的增益,以及牵引效应导致的重播如何逃过窗口评判器。 #### 创造力评估与评判器 Nakajima等人(2026)[20]指出广泛使用的分散联想任务忽视适切性,建议在适切性条件下评分新颖度。我们三个独立维度(惊奇度、连接性、连贯性)遵循同样逻辑,不通过牺牲连贯性换取新颖度。Saakyan等人(2026)[26]通过8618个专家标注证明约91%的高四分位新奇表达未被判定为创造性;我们的事实释义逃逸模式和采样器创意层面零效应独立验证了这一差距。Infini-gram[17]和Rusty-DAWG[19]使训练语料的逐字新奇度计算可规模化;我们使用infini-gram对比OLMo-2语料。在工具层面,Fein等人(2026)[9]发现测试中最强的现成评判器仅在73%的创意写作配对上与人类偏好一致,Haldar和Hockenmaier(2025)[11]记录了LLM评判器跨运行的低评分者内信度。两项警示均适用于本研究。我们通过每个窗口\(k=5\)独立评判取中位数,以及报告工具分辨率来回应后者;通过双评判器家族和部分人类评分部分回应前者,并将评判器视为主要局限(第8节)。针对长文本流窗口评判,我们额外指出三个特有问题:窗口内注入文本、超出评判器视野的重播、以及窗口与整体间的差距。 #### 循环与故事生成引导 外部循环引导生成器在故事生成中常见。SWAG[24]让第二个模型为故事模型选择后续动作。Collective Critics[1]通过多个批评模型优化计划及其表达。STORYTELLER[15]添加情节规划结构以保持长故事的连贯与凝聚。相较于这些文献,我们的贡献不在外部循环概念,而在于其精简。我们隔离的算子是单一注入句子,无规划器、批评器或奖励;因子消融显示循环的哪个部分产生了
相似文章
当多反而少:语言模型中位置相关的重复效应
本文表明,语言模型中的重复效应取决于读取位置:相邻重复会提高目标概率,而移位重复则产生倒U形曲线。这一发现挑战了完形填空式探测中的假设,并在多个模型和语言中得到了验证。
为什么语言模型比人类更不惊讶?测试解析多重性不匹配假说
本文测试了解析多重性不匹配假说,该假说认为语言模型之所以低估了人类在花园路径句中的处理困难,是因为它们能同时考虑更多的句法解析。通过使用带束搜索的循环神经网络语法(RNNGs),研究者发现减少活跃解析的数量会增大预测的花园路径效应,但远远不足以完全捕捉人类数据。
Looped语言模型改进组合工具调用
Looped语言模型通过利用循环计算来增强组合工具调用,在多步任务中提高准确性,同时自适应推理优化了性能和计算成本之间的平衡。研究表明,这些模型对于可靠的智能体系统很有前景。
词汇扰动破坏LLM推理:Attention Diversion的实证研究
本文实证研究了词汇扰动如何通过Attention Diversion破坏大语言模型推理,发现字符级噪声显著降低性能,而填充插入则影响甚微。
循环语言模型提升组合式工具调用能力
本文探讨了循环语言模型如何利用迭代潜在计算提升代理系统中的组合式工具调用,展示了对多步骤API交互的益处。