语言模型框架是组合性泛化器(49分钟阅读)
摘要
这篇博客文章认为,语言模型中更好的泛化应来自'框架'(即接口程序),而非仅仅扩展训练数据。实验表明,递归语言模型框架能够实现远超基础Transformer的长度和领域泛化。
数据扩展仍将是进步的最大驱动力。我们输入数据的机器及其归纳偏差将决定扩展的系数。更好的扩展回报需要组合性泛化。组合性泛化的能力似乎主要存在于框架中。
查看缓存全文
缓存时间: 2026/07/21 21:28
# 语言模型成为组合泛化器
Source: https://alexzhang13.github.io/blog/2026/harness/
**现代后训练已成为一种暴力范型,不断积累更多环境和更长的训练视野。**很大程度上,这是因为前沿Transformer在*组合泛化*上仍然表现不佳,组合泛化是指通过组合熟悉的问题来解决未知问题的能力。除非我们的模型能够组合它们学到的各个经验,否则扩展的回报将会低于预期,因为每个新领域都需要以训练数据的形式进行投入。
当然,训练数据并非唯一的杠杆。过去几年,我们通过*支架*Transformer来攻克更难的任务,先是思维链推理,然后是工具使用等。然而,在所有这一切中,*泛化*本身仍被留给底层神经网络及其2017年的token级归纳偏置(https://arxiv.org/abs/1706.03762)。我们认为,更好的泛化主要是如今被称为*框架*的任务。框架是位于外部世界和神经网络之间的程序:它决定如何将当前环境状态(可以任意长且复杂)编码为LLM的一个或多个输入,以及如何决定下一个动作。**框架的主要职责应该是携带一种更高层次的归纳偏置,能够将陌生且复杂的问题还原为底层神经网络的简单组合。**
具体来说,我们认为一个好的框架能够**塑造对底层Transformer的每次调用,使得每个观察都*局部在分布内***,即每次Transformer调用处理的提示与其训练数据在分布上一致。事实上,一个好的框架常常可以将那些似乎需要在后训练中取得突破的问题,简化为现有语言模型几乎平凡的能力。我们在近一年前首次展示了长上下文处理中的一个版本 (https://alexzhang13.github.io/blog/2025/rlm/),而在这篇文章中,我们展示这一原则扩展到*学习*本身的效率。也就是说,**通过精心设计的框架所学到的内容,在任务长度和领域上的泛化能力**远优于单独训练神经网络。
我们通过使用强化学习(RL)训练递归语言模型(RLM)来测试这一点。RLM是一个框架,模型可以卸载其上下文,并将执行委托给程序化分解和递归子调用。结果总结在图1中。仅在短任务上训练即可泛化到8-32倍长的保留任务,与直接训练底层Transformer相比,在相同训练提升下,评估提升大约高出10倍。此外,在一个领域上训练向其他领域迁移的速度远优于普通Transformer。
图1:长度与策略泛化提升**图1.** 我们在Qwen3-30B-A3B-Instruct-2507上分别训练RLM和基座Transformer (+ YaRN)在一组任务上,并绘制训练提升和评估提升。左侧,我们独立训练6个不同的短任务环境,并在相同的任务环境上进行评估,但上下文长度是训练的8-32倍。右侧,我们在3个不同的任务环境上训练,并在3个使用类似分解策略的不同领域上进行评估。我们发现RLM的评估提升达到或超过训练提升,而基座Transformer难以泛化。在一些长度泛化实验中,我们发现RLM起初只有非泛化的解,仅适用于短任务,但最终发现了更泛化的分解策略,使得评估提升高于训练提升。
我们观察到这种泛化效应,是因为RLM框架在具有潜在相似性的任务之间诱导出一种等价关系,这意味着RLM的主上下文在这些任务之间看到几乎相同的token级轨迹。如图2所示。这些结果表明,类似于调整模型架构和训练配方,精心设计的框架可以降低收集更多数据和生成长序列的成本,同时增加可通过后训解决的任务覆盖范围。
图2:RLM在BrowseComp-Plus和OOLONG上的轨迹同构**图2.** 递归语言模型(RLM)框架在两个不同任务上的示例——BrowseComp-Plus和OOLONG,通过将任务特定查询延迟到子调用中并通过REPL变量传递信息,它们理论上可以在根LM的上下文窗口上看到完全相同的轨迹。如果RLM在一个任务上训练,它会泛化到另一个任务,因为根LM现在可以将它们视为同构的。这种同构发生在两个
相似文章
@lateinteraction: “训练框架”开始与神经架构模糊,在谁承载实现泛化的归纳偏差方面…
研究人员提出,训练框架(训练装置)应承载用于泛化的归纳偏差,并证明训练RLMs在扩展性和泛化到更困难任务方面远优于普通Transformer。
@a1zhang: Transformer难以泛化到未明确训练过的任务。相反,我们在2026年提出,它…
文章提出,通过精心设计的harness来诱导组合,Transformer可以泛化到新任务,而无需模型本身具备泛化能力。研究表明,RLMs可以从短任务泛化到8-32倍长的任务,并且跨领域泛化。
@omarsar0:强烈推荐。我经常声称构建agent harnesses有巨大的alpha收益。结果发现harnesses是组合…
讨论了agent harnesses作为组合通用器的概念,用于模型中扩展泛化能力,并引用了RLM harness。
发展性方法揭示神经语言模型的统计学习:Transformer从最抽象的统计模式中泛化
本文采用发展性方法研究神经语言模型(特别是Transformer)如何从人工语法中学习统计模式,发现它们首先获取全局抽象统计信息,然后学习局部依赖关系,并在早期出现过度泛化。
Self-Harness: 自我改进的Harness
Self-Harness 提出了一种新范式,其中基于LLM的智能体通过挖掘模型特定的弱点、提出框架修改,并通过回归测试验证这些修改,从而迭代地改进自身的运行框架,在Terminal-Bench-2.0上跨多个基础模型取得了显著的性能提升。