语言模型框架是组合性泛化器(49分钟阅读)

TLDR AI 论文

摘要

这篇博客文章认为,语言模型中更好的泛化应来自'框架'(即接口程序),而非仅仅扩展训练数据。实验表明,递归语言模型框架能够实现远超基础Transformer的长度和领域泛化。

数据扩展仍将是进步的最大驱动力。我们输入数据的机器及其归纳偏差将决定扩展的系数。更好的扩展回报需要组合性泛化。组合性泛化的能力似乎主要存在于框架中。
查看原文
查看缓存全文

缓存时间: 2026/07/21 21:28

# 语言模型成为组合泛化器 Source: https://alexzhang13.github.io/blog/2026/harness/ **现代后训练已成为一种暴力范型,不断积累更多环境和更长的训练视野。**很大程度上,这是因为前沿Transformer在*组合泛化*上仍然表现不佳,组合泛化是指通过组合熟悉的问题来解决未知问题的能力。除非我们的模型能够组合它们学到的各个经验,否则扩展的回报将会低于预期,因为每个新领域都需要以训练数据的形式进行投入。 当然,训练数据并非唯一的杠杆。过去几年,我们通过*支架*Transformer来攻克更难的任务,先是思维链推理,然后是工具使用等。然而,在所有这一切中,*泛化*本身仍被留给底层神经网络及其2017年的token级归纳偏置(https://arxiv.org/abs/1706.03762)。我们认为,更好的泛化主要是如今被称为*框架*的任务。框架是位于外部世界和神经网络之间的程序:它决定如何将当前环境状态(可以任意长且复杂)编码为LLM的一个或多个输入,以及如何决定下一个动作。**框架的主要职责应该是携带一种更高层次的归纳偏置,能够将陌生且复杂的问题还原为底层神经网络的简单组合。** 具体来说,我们认为一个好的框架能够**塑造对底层Transformer的每次调用,使得每个观察都*局部在分布内***,即每次Transformer调用处理的提示与其训练数据在分布上一致。事实上,一个好的框架常常可以将那些似乎需要在后训练中取得突破的问题,简化为现有语言模型几乎平凡的能力。我们在近一年前首次展示了长上下文处理中的一个版本 (https://alexzhang13.github.io/blog/2025/rlm/),而在这篇文章中,我们展示这一原则扩展到*学习*本身的效率。也就是说,**通过精心设计的框架所学到的内容,在任务长度和领域上的泛化能力**远优于单独训练神经网络。 我们通过使用强化学习(RL)训练递归语言模型(RLM)来测试这一点。RLM是一个框架,模型可以卸载其上下文,并将执行委托给程序化分解和递归子调用。结果总结在图1中。仅在短任务上训练即可泛化到8-32倍长的保留任务,与直接训练底层Transformer相比,在相同训练提升下,评估提升大约高出10倍。此外,在一个领域上训练向其他领域迁移的速度远优于普通Transformer。 图1:长度与策略泛化提升**图1.** 我们在Qwen3-30B-A3B-Instruct-2507上分别训练RLM和基座Transformer (+ YaRN)在一组任务上,并绘制训练提升和评估提升。左侧,我们独立训练6个不同的短任务环境,并在相同的任务环境上进行评估,但上下文长度是训练的8-32倍。右侧,我们在3个不同的任务环境上训练,并在3个使用类似分解策略的不同领域上进行评估。我们发现RLM的评估提升达到或超过训练提升,而基座Transformer难以泛化。在一些长度泛化实验中,我们发现RLM起初只有非泛化的解,仅适用于短任务,但最终发现了更泛化的分解策略,使得评估提升高于训练提升。 我们观察到这种泛化效应,是因为RLM框架在具有潜在相似性的任务之间诱导出一种等价关系,这意味着RLM的主上下文在这些任务之间看到几乎相同的token级轨迹。如图2所示。这些结果表明,类似于调整模型架构和训练配方,精心设计的框架可以降低收集更多数据和生成长序列的成本,同时增加可通过后训解决的任务覆盖范围。 图2:RLM在BrowseComp-Plus和OOLONG上的轨迹同构**图2.** 递归语言模型(RLM)框架在两个不同任务上的示例——BrowseComp-Plus和OOLONG,通过将任务特定查询延迟到子调用中并通过REPL变量传递信息,它们理论上可以在根LM的上下文窗口上看到完全相同的轨迹。如果RLM在一个任务上训练,它会泛化到另一个任务,因为根LM现在可以将它们视为同构的。这种同构发生在两个

相似文章

Self-Harness: 自我改进的Harness

Hacker News Top

Self-Harness 提出了一种新范式,其中基于LLM的智能体通过挖掘模型特定的弱点、提出框架修改,并通过回归测试验证这些修改,从而迭代地改进自身的运行框架,在Terminal-Bench-2.0上跨多个基础模型取得了显著的性能提升。