@a1zhang: Transformer难以泛化到未明确训练过的任务。相反,我们在2026年提出,它…
摘要
文章提出,通过精心设计的harness来诱导组合,Transformer可以泛化到新任务,而无需模型本身具备泛化能力。研究表明,RLMs可以从短任务泛化到8-32倍长的任务,并且跨领域泛化。
查看缓存全文
缓存时间: 2026/07/20 19:37
Transformer 难以泛化到未明确训练过的任务。因此,我们在 2026 年提出,泛化的职责应由 harness 通过组合来完成。
我们在训练 RLM 时观察到一种强大特性:对于具有共享结构但外观不同的任务,根模型会自然地学习到相同的轨迹,也就是说,它将两个任务轨迹视为相同!换句话说,Transformer 无需额外的泛化能力即可将能力从一项任务迁移到另一项任务,这是由 harness 引发的。
我们发现,设计良好的 harness 会在任务轨迹上形成一个商集,这意味着它们的每个 LLM 调用可以将结构上“相似”的任务视为几乎逐 token 相同的!在训练过程中,harness 可以有效地为 Transformer 进行泛化,而无需依赖模型本身的任何内在泛化能力。
例如,RLM 可以将不同长度的问题视为相同:我们证明,RLM 可以完全在短任务上训练,并完全泛化到类似但未见过的、长度 8-32 倍的任务上,因为它为两者生成了近乎相同的轨迹。
更进一步,我们展示了跨不同领域(例如数学解答与论文写作)但共享分解策略的任务也表现出相同的泛化效果。RLM 可以在寻找属于同一作者的论文的问题上进行训练,并提高在寻找具有相似解答的数学问题上的性能。
完整博文、实验和讨论见下方线程。
阅读完整博文,以下为精简摘要:
我们通常处理涉及智能体(agent)和任意环境的应用程序。我们观察到的状态与采取的行动之间的层是 harness,它是对 LM 的程序化调用。
harness 的关键理想属性是将状态转换为观察(即轨迹),使其“局部处于分布内”(LID),这意味着即使整体任务处于分布外(OOD),每个单独的 LLM 调用看到的提示(prompt)在其训练数据中都是可解/处于分布内的。
像 Claude Code、Codex、ReAct 等 harness 会朴素地将所有观察、工具调用输出和推理结果追加到上下文中,这会迅速膨胀主上下文。主上下文因此变得对底层神经网络而言处于分布外,这就是为什么我们需要耗费大量精力来获取我们在目标环境中使用智能体所需的海量多样化智能体轨迹。
一个设计良好的 harness 可以将许多结构相似的轨迹简化为相同的 token 轨迹,从而通过对环境进行直接的规模扩展来实现更好的泛化特性。
我们观察到 Transformer 在“组合泛化”方面表现不佳(即,如果 LM 能解决 A,我们不确定它是否能递推地解决 B)。这意味着它们通常不会组合熟悉的模式来解决相似的未见问题。这也意味着,如果两个提示在结构上拥有大部分相同的信息,但在 token 级别上完全不同,LM 可能会以不同方式响应它们。
像 RLM 这样的 harness 可以通过上下文卸载和程序化子调用,将 A 和 B 视为同一个问题(如果它们共享潜在结构)。我们可以利用这种行为在简单任务上进行训练,并比标准基座模型更好地泛化到更困难的任务。我们观察到这种泛化效果,是因为 RLM harness 在具有潜在相似性的任务之间诱导出等价关系,使得 RLM 的主上下文在这些任务之间看到近乎相同的 token 级轨迹。
换句话说,harness 在具有共享结构的任务之间诱导出等价关系。这个由 harness 诱导的商集(Hi/Q)描述了模型需要学习才能泛化到共享这些轨迹的任务的唯一可学习轨迹!
在 6 个不同的基准测试上,我们分别训练了一个 30B 模型作为 RLM 和基座 Transformer,使用环境的短任务拆分,并在长度 8-32 倍的任务拆分上进行评估。我们发现,虽然两者在可比的训练时间内保持相似的训练奖励曲线,但 RLM 在长任务上的泛化能力显著更强。
当 LLM 学习到一种与长度无关的程序化子调用策略时,harness 会诱导出长度泛化。在大多数情况下,它会自然学习这些策略,但我们还进行了一次“分解引导”消融实验,明确告诉模型提出分解方案,并证明在 LLM 未学习到合适策略(例如 MRCRv2)的情况下,这会有帮助。
长度泛化是更一般情况的一个子集:RLM harness 学会将两个结构相似的任务视为同构。
在 3 个不同的基准测试上,我们分别训练了一个 30B 模型作为 RLM 和基座 Transformer,在一个领域(例如寻找写作风格相似的论文)上训练,并在另一个领域(例如寻找解答相似的数学问题)上评估。与长度泛化类似,我们发现 RLM 学习到了领域无关的策略,并跨领域实现了泛化。
我们的结果表明,与调整模型架构和训练方案类似,精心设计的 harness 可以降低整理更多数据以及生成更长 rollout 的成本,同时增加通过后训练可解决的任务覆盖范围。
人们可能倾向于通过已知的归纳偏置来训练 harness,但这可能会与我们领域在模型训练方面的研究相抵触。具有理想特性的 harness 可以与扩展技术相结合,以相同的成本产生更广泛的可解任务类别。在我们的实验中,我们选择尽可能朴素地训练,以反映未来工作可能如何围绕这些 harness 进行设计和训练!
与 @lateinteraction 合著!
特别感谢 @bradenjhancock 和 @LaudeInstitute 通过 Laude Slingshots 计划在短时间内慷慨提供了多个 8xH100 节点,帮助运行这些实验。感谢我在 MIT OASYS 的出色实验室伙伴和 @NoahZiems 在撰写博文时提供的有益反馈。
相似文章
@lateinteraction: “训练框架”开始与神经架构模糊,在谁承载实现泛化的归纳偏差方面…
研究人员提出,训练框架(训练装置)应承载用于泛化的归纳偏差,并证明训练RLMs在扩展性和泛化到更困难任务方面远优于普通Transformer。
@omarsar0:强烈推荐。我经常声称构建agent harnesses有巨大的alpha收益。结果发现harnesses是组合…
讨论了agent harnesses作为组合通用器的概念,用于模型中扩展泛化能力,并引用了RLM harness。
@rohanpaul_ai: 新微软论文认为,Transformer在学会紧凑内部状态时泛化更好,而不仅仅是预测下一个token……
微软的NextLat论文提出了一种自监督训练方法,让Transformer预测其下一个隐藏状态而非仅仅下一个token,从而形成更紧凑的世界模型,更好地进行规划和推理,并且生成速度提升高达3.3倍。
发展性方法揭示神经语言模型的统计学习:Transformer从最抽象的统计模式中泛化
本文采用发展性方法研究神经语言模型(特别是Transformer)如何从人工语法中学习统计模式,发现它们首先获取全局抽象统计信息,然后学习局部依赖关系,并在早期出现过度泛化。
@ZhihuFrontier: 半年前,一位知乎答主预测下一个Transformer将吸收循环、递归状态、稀疏路由……
一位知乎答主半年前的预测——下一个Transformer将吸收循环、递归状态、稀疏路由和潜在推理——随着Loop Engineering的推进,正变得越来越有现实意义。本文探讨了未来的Transformer架构如何演变为混合模型:将线性复杂度的层用于背景上下文,注意力机制用于精确推理,再加上更细粒度的稀疏性和原生的System 2推理。