将均值推向已知良好点,而非超越它:推断时干预和权重巩固在开放生成中获得了什么
摘要
本文研究了推断时干预和权重巩固对开放生成式人工智能的影响,发现训练于价值过滤后的候选项可以提升平均质量,但并未超越经典启发式性能。
arXiv:2608.28886v1 公告类型:新
摘要:生成循环从学习自身验证的成功中获得了什么?在在线装箱问题的生成、验证、选择和LoRA巩固循环中,训练于价值过滤后的候选项使得模型在保留变体上的输出向价值偏移(超额-1.7点,p=0.008;与随机巩固控制相比-3.1点,p=0.004),而观察到的最佳候选项收敛到经典启发式水平,不再提升。验证电池将整个过程重复三次,使用新种子和一个从未使用的保留集仅读取一次:在所有三个系谱中均值几乎相同(-2.0、-1.8、-1.9),并且在所有七个可评估的保留变体内汇总后,所有变体都支持巩固(p=0.008)。观察到的最佳候选项移动到经典启发式水平,完全相同(在所有三个系谱中为0.021028,吸引子和随机控制都如此),且从未超越。一个匹配的纯SFT控制显示,监督锚定,而非对不良候选项的排斥,是集中的原因(96%的候选项恰好落在经典启发式水平)。尾巴双向切割:巩固降低了每个候选项优于经典的比率(从10%降至3.9%),但其更大的产量在绝对数量上产生了更多此类候选项(5对1,基于少量事件)。作为动机,我们报告了导致此处的推断时账本:模型编写的示意图回顾购买了判断的文档集成,而没有任何购买发展;一个验证器被写入流中被模仿,每个笔记本中有16.4个伪造的判断行。有效候选项的平均质量可以被购买和复制;观察到的最佳达到经典水平,到目前为止从未超越。
查看缓存全文
缓存时间: 2026/09/01 12:09
# 将均值移向已知最优,而非超越它:开放生成中推理时干预与权重整合的收益 来源:https://arxiv.org/html/2608.28886 ###### 摘要 生成循环从自身验证的成功中学习能获得什么?在生成、验证、选择并在在线装箱问题上进行 LoRA 整合的循环中,基于价值筛选候选进行训练,会将模型在未见变体上的输出价值向中心偏移(相对于随机整合对照组,超额减少 -1.7 至 -1.7 点,p=0.008;与 -3.1 至 -3.1 相比,p=0.004),同时最佳观测候选收敛至经典启发式算法的水平且不再超越。一个确认性测试集使用全新的种子,仅阅读一次从未使用的留出集,完整复制了整个过程三次:三个谱系的均值几乎一致(-2.0、-1.8、-1.9),在汇总所有七个可评估的留出变体后,均支持整合(p=0.008)。最佳观测候选移动*到*经典启发式算法的水平,在三个谱系中均精确为 0.021028,无论是吸引组还是随机对照组,且从未超越。一个仅使用 SFT 的匹配对照组表明,监督锚定而非对差候选的排斥,才是实现集中的关键(96% 的候选恰好落在经典启发式算法的水平)。长尾效应双向存在:整合降低了每个候选优于经典算法的比率(从 10% 降至 3.9%),但其更大的产出总量带来了绝对数量更多的此类候选(5 对 1,基于少量事件)。作为动机,我们报告了导向此处的推理时记录:模型编写的图式概要复述获得了判定的文档整合度,而其他均未促进发展;被写入流的验证器被模仿,每个笔记本产生 16.4 行伪造的判定。有效候选的平均质量可以被购买和复制;观测到的最佳结果是达到经典水平,且到目前为止,从未超越。 ## 1引言 [Ono Filho [7]](https://arxiv.org/html/2608.28886#bib.bib7) 在 24 种条件下拆解了一个受认知启发的生成循环,发现其对判定新颖性的影响大部分源于一个操作:*中断*。每隔几百个标记注入一个新主题到一个抑制了逐字重复的文本流中。在新鲜生成文本的窗口上,中断将判定惊喜度提高了 1.2 到 1.4 分(仅基于习惯化),在三个基础模型(一个后训练模型和两个流派)上得到验证,且一个预先注册的复制实验也确认了这一点。该研究以三个否定结论结束。作为完整文档阅读时,没有任何文本流构建任何东西(在整合、发展、连贯性或惊喜度上,没有分支得分高于 2.5,0-10 分,基于去除注入文本后的 4,500 个标记进行判定);一个决定何时不中断的审阅者门控评审并未改变这一点;而在在线装箱问题中,一个确定性验证器取代了审阅者,中断使基础模型生成的有效、不同启发式候选增加了三到四倍,但并未提高最佳结果的质量。中断是一种变异算子,没有选择的变异是有序的噪声。 本文延续了那项研究留下的问题:什么能使局部收益组合起来?我们通过逐步赋予循环一个能够发现的心智所拥有而循环最初缺乏的东西,并在配套研究证明必要的协议(仅生成文本窗口、仅新鲜估计、文档级阅读、以前提作为推理单元、存在确定性验证器时使用它)下进行测量来推进。这些部分包括:(i) *图式*记忆,其中模型携带其自身文本流的压缩复述,而非使其产生依赖的逐字文本[1 (https://arxiv.org/html/2608.28886#bib.bib1)];(ii) *持续性问题*,其中中断指向文本流自身未解决的问题,而非偏离它[16 (https://arxiv.org/html/2608.28886#bib.bib16)];(iii) *选择*,一种 FunSearch 风格的进化,作用于中断产生的候选[9 (https://arxiv.org/html/2608.28886#bib.bib9)];(iv) *流内验证器*,其对每个候选的判定被写回笔记本;以及 (v) *整合*,STaR/ReST 循环,其中模型在其自身经训练-验证器-选择的候选上进行微调(LoRA)并再次生成[17 (https://arxiv.org/html/2608.28886#bib.bib17), 3 (https://arxiv.org/html/2608.28886#bib.bib3), 11 (https://arxiv.org/html/2608.28886#bib.bib11)],随后是基于偏好的排斥[8 (https://arxiv.org/html/2608.28886#bib.bib8)]和旨在保留长尾的质量-多样性选择[5 (https://arxiv.org/html/2608.28886#bib.bib5), 4 (https://arxiv.org/html/2608.28886#bib.bib4)]。前两个部分作为研究动机被简要报告;论文的核心是整合主线及其复制。每个测试集在运行前都已预先注册;预先注册文件、其带日期的修正案以及结果均在随代码发布的实验室笔记本中。 ### 贡献. (1) 基于训练-验证器-选择候选的 LoRA 整合,将候选分布从未见过的训练族变体上向价值中心偏移(p=0.008;与随机整合对照组相比,p=0.004),将观测到的最佳结果移至经典启发式算法水平而非超越,并且不能迁移至其他族。(2) 一个确认性测试集:三个独立的谱系,使用全新种子和一个仅阅读一次的从未使用的留出集,发现每个谱系中存在相同的均值偏移(-2.0、-1.8、-1.9 点;所有七个可评估的变体均支持整合,p=0.008)以及相同的最佳结果收敛性,在每个谱系中均精确达到经典水平;一个仅使用 SFT 的匹配对照组表明,监督锚定而非排斥项,实现了族内集中,而排斥项则显著改变了族外行为。(3) 长尾效应,双向存在:每个候选优于经典的比率在未经训练的基础模型中最高,而吸引组的更大产出带来了绝对数量更多的长尾事件;pass@kk 在留出的族内变体上相对于经典算法为零。(4) 作为动机的推理时记录:模型编写的图式概要复述以零局部成本获得了程序最高的文档整合度,被写入流的验证器被模仿而非使用(每个笔记本 16.4 行伪造判定),没有任何注入能使发展突破进展墙。(5) 整体解读:推理时刺激重组了一个固定的先验;权重整合将其质量向已知最优移动,每个候选在长尾上的成本与产出的增益并列报告。 ## 2相关工作 ### 基于自身输出的自训练. STaR[17 (https://arxiv.org/html/2608.28886#bib.bib17)] 在模型自身导致正确答案的推理过程上进行微调;ReST[3 (https://arxiv.org/html/2608.28886#bib.bib3)] 和 ReST-EM[11 (https://arxiv.org/html/2608.28886#bib.bib11)] 交替进行采样、基于奖励的过滤和监督微调,并报告了在几次迭代后饱和的增益。我们的吸引组是该方案的办公规模版本(一个 8B 模型,每个循环 40 个示例,秩 8 适配器),附带三项补充:一个同等规模的随机整合对照组,用以区分“在自身输出上训练”与“在验证器批准的内容上训练”;从未进入任何训练集的变体和族上测量的迁移效果;以及优于经典启发式的候选比率,这正是自训练的成本所在。 我们的整合结果接近于奖励训练集中概率于现有轨迹的发现,提高了低-kk性能,而大-kk覆盖保持不变或下降[15 (https://arxiv.org/html/2608.28886#bib.bib15)]。文献中也存在明确其范围的反例:边界引导的课程 RL 报告将 pass@1 和 pass@256 均提升至基线以上[2 (https://arxiv.org/html/2608.28886#bib.bib2)],基于表示的探索奖励改善了后训练中的 pass@k[13 (https://arxiv.org/html/2608.28886#bib.bib13)];两者都增加了此处所缺乏的外部指导或超越模型自身展开的定向探索。 ### 偏好优化. DPO[8 (https://arxiv.org/html/2608.28886#bib.bib8)] 基于选择/拒绝对优化策略相对于冻结的参考。我们的排斥组使用它时,将模型自身最差的候选或已知最优的克隆作为拒绝样例;无锚定时它退化,锚定时在选择侧加入监督项则使策略锐化到已知最优上。这两种行为都是偏好优化已知的成功与失败模式;我们新增的是它们对由验证器测量的候选分布长尾的影响。 ### 质量-多样性. MAP-Elites[5 (https://arxiv.org/html/2608.28886#bib.bib5)] 和新颖性搜索[4 (https://arxiv.org/html/2608.28886#bib.bib4), 12 (https://arxiv.org/html/2608.28886#bib.bib12)] 保留每个行为类别中的最佳解,而非全局最佳。我们的 qd 组为验证器的每个实例行为类别整合一个精英;它保持了功能多样性,在此情境下,同时失去了价值和长尾。 ### 验证搜索. FunSearch[9 (https://arxiv.org/html/2608.28886#bib.bib9)] 和 AlphaEvolve[6 (https://arxiv.org/html/2608.28886#bib.bib6)] 将未经训练的提议模型与硬性评估器及大量样本配对,不微调提议者。我们的结果与该选择一致:未经训练的先验具有最高比例优于经典的候选,而我们运行的每次整合都降低了这个比例。 ### 记忆、张力与审阅者. 图式记忆作为重建[1 (https://arxiv.org/html/2608.28886#bib.bib1)];未完成任务作为保留的张力[16 (https://arxiv.org/html/2608.28886#bib.bib16)];压缩进度作为内在奖励[10 (https://arxiv.org/html/2608.28886#bib.bib10)]。在工具层面,配套研究记录了基于窗口的 LLM 审阅者无法看到的内容(注入文本、超出其窗口的自我复制、窗口与整体);第 5 节[5 (https://arxiv.org/html/2608.28886#S5)] 中的伪造判定是同样的依赖效应作用于放置在提示中的验证器输出。 ## 3设置 ### 生成器与循环. 除非另有说明,生成器为 Qwen3-30B-A3B-Base(混合专家模型,8 位,Apple M5 Pro 上的 MLX);测试集 C 使用 Qwen3-8B-Base(8 位),因为它被微调。一个单元是一个前提(配套研究的十个前提之一)续写 4,500 个标记,并屏蔽文本结束标记;习惯化(基于窗口的重复惩罚,窗口 512,系数 1.15)在每个组中开启;中断按每隔 300 个标记的时钟触发。各组的区别在于注入的内容以及上下文是保留还是重建。 ### 评判. 仅使用生成文本的窗口(96 个标记,起始于任何注入文本之后 32 个标记,从不跨越注入点),由 Claude Opus 5(k=5,中位数)对惊喜度、连接性和连贯性进行评判,基于 600 个标记的上下文;被标记为自我复制(其 12 个标记的片段在文本流中较早出现过一半)的窗口被排除在仅新鲜估计之外。去除注入文本后的整个文本流,每个单元被评判一次(k=3),评判整合度、发展度、连贯性和惊喜度。前提是单元:单元均值、基于单元的 bootstrap 置信区间、配对单元的精确符号翻转排列检验(预先注册的为单侧)。 ### 验证器的问题. 采用 FunSearch 形式的在线装箱问题:模型编写一个包含 priority(item, remaining) 函数的笔记本;验证器打包实例并报告超出下界的平均超额。测试集 S 和 V 使用配套研究的十个分布变体(项目范围在 [0.1, 0.8] 内,其中最佳拟合接近最优);测试集 C 转向小项目分布族,其中最佳拟合可测量地被超越(第 6 节[6 (https://arxiv.org/html/2608.28886#S6)])。 ## 4记忆与张力:推理时动机 本节是研究的动机,保持简短;论文的核心是随后的整合主线。五个组改变了中断流的记忆内容和中断所提的问题(周期 300,十个前提):*逐字*组在中断间保留完整上下文;*重置*组从前提和新主题重建上下文;*图式*组从前提、模型关于其自身最近 1,200 个标记编写的两到三句话的复述以及新主题重建上下文;*问题*组保留上下文并注入模型从其自身流中提取的开放问题;*议程*组结合了重置、复述和问题。复述和问题计为注入文本(从不评判;从文档中移除),并带有一个防止模型重复其自身复述的反复制阶梯。 表 1:文档级阅读(整个 4,500 标记流,去除注入文本;Opus 5,k=3;十个前提的单元均值,0-10 分)。图式复述给出了程序最高的整合度;没有任何组在发展度上超过 2.0。预先注册的对比(单侧精确配对排列,十个前提):图式组在复合指标上以 +1.65 [+1.15, +2.25],p=0.001 优于逐字组;与重置组相比,注册的复合指标未得到支持(+0.45, p=0.13;分解来看,整合度 +0.70 [+0.10, +1.30],发展度 +0.20),因此头条的大部分是重置组的效果,而复述在此基础上增加了整合度,且在新鲜窗口上无成本(所有新鲜对比 n.s.,自我复制 0%)。问题组在保留上下文的情况下优于中性主题组(+0.70, p=0.004),但在发展度上与习惯化匹配;议程组相对于图式组没有增加(+0.20, p=0.38;文档审阅者:“用新的选角和流派反复重启前提”)。激励论文其余部分的解读是:记住图式优于重读文本,但每个注册的注入都移动了整合度,且发展度从未显著超过 2/10,这就是*进展墙*。 ## 5选择与验证器 ### 测试集 S:选择循环中的中断. 一个 FunSearch 风格的进化(10 个变体 × 8 代 × 每代 16 个样本;提示显示当前种群;按变体配对),在提示中注入或不注入中断的角度线。S1(冠军在留出实例上的增益):+0.0013 [-0.0015, +0.0047],p=0.38。S2(累积的不同有效候选):89.5 对比 95.1,p=0.86(相对于假设)。S3(首次超越最佳拟合的生成):+0.5,n.s.。在选择下,中断没有增加任何东西,甚至没有在单个流中增加的多样性:种群提示已经提供了中断所能提供的内容。 ### 测试集 V:流内的验证器. 配套研究测试集 B 的笔记本,分块生成;每当一个 priority 函数关闭时,评估器在训练实例上对其进行评分,并将判定作为注释写入笔记本(“# Verifier: priority_x 在训练实例上平均超额 0.0812(比最佳拟合 0.0752 更差);无改进。”)。另一个组每 300 个标记增加一个确定性的计分板(“# 到目前为止:尝试了 N 个函数;最佳是 ...;最佳拟合位于 ...”)和一个基于价值锚定的开放问题。十个变体 × 两个种子;基线是测试集 B 的普通组和角度组按文本顺序重新评分。V1(留出增益,反馈 vs 角度):+0.0003,p=0.48。V2(在...
相似文章
干预还是不干预:使用概率模型融合引导推理时对齐
本文介绍了BlendIn,一个推理时对齐框架,它使用概率模型融合来评估指导可靠性并按比例加权模型贡献,通过避免有害干预实现了高达50%的性能提升。
@rohanpaul_ai: 一个自我改进的智能体可以保持其权重冻结,但仍然会因它学会信任的记忆而变得更糟。这些…
论文《Memory Reward Inflation in Self-Improving LLM Agents》表明,权重冻结的自我改进智能体仍可能因信任有缺陷的LLM生成的记忆分数而退化,模型认可自身31%–54%的错误答案。这种“回声差距”在更强的LLM中依然存在。
模型能力主导:AIMO 3推理时优化的经验启示
本论文分析了AIMO 3的推理时优化技术,发现模型能力优于提示工程和多样化采样策略。研究表明高温度采样已经能够最大程度地去相关化误差,为基于提示的改进留下了很少余地,并识别出单个模型pass@20与多数投票共识之间存在6分的选择损失差距。
迭代指令微调中从合成数据学习避免模型崩溃
本文研究了迭代指令微调中使用合成数据时的模型崩溃问题,揭示了崩溃表现为能力极化:强项被强化,弱项则进一步退化。提出了KITE,一个两阶段框架,结合失败引导的数据生成和边界感知的不确定性筛选,确保在多次迭代中稳定提升。
微调是否会撤销激活引导?行为恢复而无权重编辑逆转
本文研究微调是否会撤销语言模型中的激活引导,发现尽管在优化压力下,拒绝抑制等行为效应可能退化,但底层的权重修改在机制上保持稳定。