@a1zhang: Transformer难以泛化到未明确训练过的任务。相反,我们在2026年提出,它…

X AI KOLs Following 论文

摘要

文章提出,通过精心设计的harness来诱导组合,Transformer可以泛化到新任务,而无需模型本身具备泛化能力。研究表明,RLMs可以从短任务泛化到8-32倍长的任务,并且跨领域泛化。

Transformer难以泛化到未明确训练过的任务。相反,我们在2026年提出,通过组合进行泛化是harness的职责。 我们在训练RLMs时观察到一个强大的特性:对于具有共享结构但看起来不同的任务,根模型会自然地学习到相同的轨迹,这意味着它将两个任务轨迹视为相同!换句话说,Transformer不需要额外的泛化能力来将一个任务的能力迁移到另一个任务,harness就提供了这种能力。 我们发现,精心设计的harnesses在任务轨迹上形成商集,这意味着它们各自的LLM调用可以将结构上“相似”的任务视为近乎相同——逐token一致!Harnesses可以在训练期间有效地为Transformer进行泛化,而无需依赖模型本身的任何内在泛化能力。 例如,RLMs可以将不同长度的问题视为相同:我们展示RLMs可以仅在短任务上训练,并完全泛化到相似但未见过的长8-32倍的任务,因为它为两者生成了近乎相同的轨迹。 进一步,我们展示跨不同领域(例如数学解题与论文写作)但共享分解策略的任务表现出相同的泛化效果。RLMs可以在‘找出哪些论文属于同一作者’的问题上训练,并提升在‘找出具有相似解法的数学问题’上的表现。 完整的博客文章、实验和讨论见下方线程。
查看原文
查看缓存全文

缓存时间: 2026/07/20 19:37

Transformer 难以泛化到未明确训练过的任务。因此,我们在 2026 年提出,泛化的职责应由 harness 通过组合来完成。

我们在训练 RLM 时观察到一种强大特性:对于具有共享结构但外观不同的任务,根模型会自然地学习到相同的轨迹,也就是说,它将两个任务轨迹视为相同!换句话说,Transformer 无需额外的泛化能力即可将能力从一项任务迁移到另一项任务,这是由 harness 引发的。

我们发现,设计良好的 harness 会在任务轨迹上形成一个商集,这意味着它们的每个 LLM 调用可以将结构上“相似”的任务视为几乎逐 token 相同的!在训练过程中,harness 可以有效地为 Transformer 进行泛化,而无需依赖模型本身的任何内在泛化能力。

例如,RLM 可以将不同长度的问题视为相同:我们证明,RLM 可以完全在短任务上训练,并完全泛化到类似但未见过的、长度 8-32 倍的任务上,因为它为两者生成了近乎相同的轨迹。

更进一步,我们展示了跨不同领域(例如数学解答与论文写作)但共享分解策略的任务也表现出相同的泛化效果。RLM 可以在寻找属于同一作者的论文的问题上进行训练,并提高在寻找具有相似解答的数学问题上的性能。

完整博文、实验和讨论见下方线程。

阅读完整博文,以下为精简摘要:

我们通常处理涉及智能体(agent)和任意环境的应用程序。我们观察到的状态与采取的行动之间的层是 harness,它是对 LM 的程序化调用。

harness 的关键理想属性是将状态转换为观察(即轨迹),使其“局部处于分布内”(LID),这意味着即使整体任务处于分布外(OOD),每个单独的 LLM 调用看到的提示(prompt)在其训练数据中都是可解/处于分布内的。

像 Claude Code、Codex、ReAct 等 harness 会朴素地将所有观察、工具调用输出和推理结果追加到上下文中,这会迅速膨胀主上下文。主上下文因此变得对底层神经网络而言处于分布外,这就是为什么我们需要耗费大量精力来获取我们在目标环境中使用智能体所需的海量多样化智能体轨迹。

一个设计良好的 harness 可以将许多结构相似的轨迹简化为相同的 token 轨迹,从而通过对环境进行直接的规模扩展来实现更好的泛化特性。

我们观察到 Transformer 在“组合泛化”方面表现不佳(即,如果 LM 能解决 A,我们不确定它是否能递推地解决 B)。这意味着它们通常不会组合熟悉的模式来解决相似的未见问题。这也意味着,如果两个提示在结构上拥有大部分相同的信息,但在 token 级别上完全不同,LM 可能会以不同方式响应它们。

像 RLM 这样的 harness 可以通过上下文卸载和程序化子调用,将 A 和 B 视为同一个问题(如果它们共享潜在结构)。我们可以利用这种行为在简单任务上进行训练,并比标准基座模型更好地泛化到更困难的任务。我们观察到这种泛化效果,是因为 RLM harness 在具有潜在相似性的任务之间诱导出等价关系,使得 RLM 的主上下文在这些任务之间看到近乎相同的 token 级轨迹。

换句话说,harness 在具有共享结构的任务之间诱导出等价关系。这个由 harness 诱导的商集(Hi/Q)描述了模型需要学习才能泛化到共享这些轨迹的任务的唯一可学习轨迹!

在 6 个不同的基准测试上,我们分别训练了一个 30B 模型作为 RLM 和基座 Transformer,使用环境的短任务拆分,并在长度 8-32 倍的任务拆分上进行评估。我们发现,虽然两者在可比的训练时间内保持相似的训练奖励曲线,但 RLM 在长任务上的泛化能力显著更强。

当 LLM 学习到一种与长度无关的程序化子调用策略时,harness 会诱导出长度泛化。在大多数情况下,它会自然学习这些策略,但我们还进行了一次“分解引导”消融实验,明确告诉模型提出分解方案,并证明在 LLM 未学习到合适策略(例如 MRCRv2)的情况下,这会有帮助。

长度泛化是更一般情况的一个子集:RLM harness 学会将两个结构相似的任务视为同构。

在 3 个不同的基准测试上,我们分别训练了一个 30B 模型作为 RLM 和基座 Transformer,在一个领域(例如寻找写作风格相似的论文)上训练,并在另一个领域(例如寻找解答相似的数学问题)上评估。与长度泛化类似,我们发现 RLM 学习到了领域无关的策略,并跨领域实现了泛化。

我们的结果表明,与调整模型架构和训练方案类似,精心设计的 harness 可以降低整理更多数据以及生成更长 rollout 的成本,同时增加通过后训练可解决的任务覆盖范围。

人们可能倾向于通过已知的归纳偏置来训练 harness,但这可能会与我们领域在模型训练方面的研究相抵触。具有理想特性的 harness 可以与扩展技术相结合,以相同的成本产生更广泛的可解任务类别。在我们的实验中,我们选择尽可能朴素地训练,以反映未来工作可能如何围绕这些 harness 进行设计和训练!

与 @lateinteraction 合著!

特别感谢 @bradenjhancock 和 @LaudeInstitute 通过 Laude Slingshots 计划在短时间内慷慨提供了多个 8xH100 节点,帮助运行这些实验。感谢我在 MIT OASYS 的出色实验室伙伴和 @NoahZiems 在撰写博文时提供的有益反馈。

相似文章

@ZhihuFrontier: 半年前,一位知乎答主预测下一个Transformer将吸收循环、递归状态、稀疏路由……

X AI KOLs Timeline

一位知乎答主半年前的预测——下一个Transformer将吸收循环、递归状态、稀疏路由和潜在推理——随着Loop Engineering的推进,正变得越来越有现实意义。本文探讨了未来的Transformer架构如何演变为混合模型:将线性复杂度的层用于背景上下文,注意力机制用于精确推理,再加上更细粒度的稀疏性和原生的System 2推理。