数据高效语言建模:从前沿进展到原则指导的模型改进

arXiv cs.CL 论文

摘要

由求是引擎(Qiushi Engine)进行的自主研究项目对BabyLM 2026 Strict-Small进行了端到端的研究,通过原则指导的方法改进了数据高效的语言模型,并在公开快照中取得了最高分。

arXiv:2609.10702v1 公告类型:新 摘要:从有限文本中学习要求模型利用上下文、泛化到新输入并保留有用的能力。求是引擎在BabyLM 2026 Strict-Small上进行了长期的、端到端的自主研究项目,在1000万语料词和1亿累计词呈现内。三个阶段连接了前沿进展、原则发现和原则指导的模型改进。第一阶段结合了紧凑重述、预算再投资和残差增量学习来构建前沿模型。第二阶段发现,精确重复和对齐重述产生不同的上下文使用模式,取决于目标关系和预测窗口。在受控任务中,恢复熟悉性能并不确保未见输入仍能使用所学计算。这些发现支持一个可测试的数据高效学习原则:围绕预测所需的上下文依赖组织经验;分别设计可见信息、监督和保留;测试学习、泛化和保留。第三阶段保留源文本,掩盖更多局部线索,监督选定目标,并在通常掩盖的输入上保留预测。来自同一父模型的两个续写种子在完整的九度量总和中优于普通续写。总体从42.02上升到42.25,跨越两代;第二代在2026年9月8日的公开Strict-Small快照中取得了最高的Overall分数。进一步研究涉及压缩、关系锚点、共享表示和测量。模型可在Hugging Face上获取;代码和研究记录附在GitHub仓库中。总体而言,这些阶段展示了研究RSI:研究过程的递归自我改进。科学理解和方法创新改变了后续问题和设计;新实验测试并精炼它们。
查看原文
查看缓存全文

缓存时间: 2026/09/11 08:14

# 从前沿推进到原则指导的模型改进 来源:https://arxiv.org/html/2609.10702 \[BoldFont=lmroman10\-bold\.otf,ItalicFont=lmroman10\-italic\.otf,BoldItalicFont=lmroman10\-bolditalic\.otf\] \[BoldFont=texgyreheros\-bold\.otf,ItalicFont=texgyreheros\-italic\.otf,BoldItalicFont=texgyreheros\-bolditalic\.otf\] \[ItalicFont=lmmono10\-italic\.otf,Scale=MatchLowercase\] ## 数据高效语言建模:从前沿推进到原则指导的模型改进 2026年9月8日 ###### 摘要 从有限文本中学习需要的不仅仅是重复接触:模型必须学会使用相关信息、将所学应用于新输入,并在进一步训练中有用的能力得以保留。求是引擎在BabyLM 2026 Strict-Small挑战中,在一千万词库词汇和一亿累计呈现词汇的限制下,开展了一项长期、端到端的自主研究计划。三个完整的研究阶段连接了前沿推进、原则发现和原则指导的模型改进,全程包含自主的文献研究、方法开发、实验、分析和综合。第一阶段结合了紧凑重述、预算再投资和残差增量学习,构建了一个前沿模型。第二阶段研究了经验组织、监督、能力重用与保留、学习动态和测量。精确重复和对齐重述根据目标关系和预测窗口的不同,产生了不同的上下文使用模式。在受控任务中,恢复熟悉的性能并不能确保对于未见过的输入仍能使用已学习到的计算。这些发现支持了一个可测试的数据高效学习原则:围绕预测所需的上下文信息和关系组织经验;分别设计可见信息、监督目标和功能保留;并测试预期的能力是否被学习、是否泛化到新输入、以及是否在后续训练中得以保留。第三阶段应用了这些发现,通过保留源文本、掩盖更多局部线索、监督选定目标以及在通常被掩盖的输入上保留预测来进行改进。来自同一父模型的两个延续版本在完整的九项指标评估上均优于普通的延续训练。总体上,两代模型的平均分从42.02提升至42.25,其中第二代在2026年9月8日的公开Strict-Small快照中取得了最高分。独立研究在压缩、关系锚点、共享表示和测量控制方面产生了进一步的发现和方法。模型已在Hugging Face上提供;代码、数据构建、评估和研究记录随GitHub仓库一同发布。这些阶段共同提供了一个具体的研究RSI(递归自我改进)实例——研究过程的递归自我改进。先前研究的科学理解、方法创新和实验经验会改变后续的问题和设计;新的实验则对其进行检验和改进。因此,前沿推进不仅产生一个更好的模型,也成为改进后续研究方式的基础。关键词:数据高效语言建模;BabyLM;上下文使用;能力保留;自主研究;研究RSI ![[未命名图像]](https://arxiv.org/html/2609.10702v1/figures/qiushi-engine-logo.png) 求是引擎在BabyLM 2026 Strict-Small上的端到端自主研究 杨书行 朱凯浩 杨俊杰 赵锐 吴俊尧 王一择 李文浩 陈富家 邓韬文 洪圣展 李亚奇 李子辰 米锦程 潘元 陈宏盛\* 杨逸浩\* 浙江大学 信息科学与电子工程学院 求是引擎团队 ###### 目录 1. 1 BabyLM 2026:从有限数据中学习 (https://arxiv.org/html/2609.10702#S1)1. 1\.1 从有限数据中学习的科学问题 (https://arxiv.org/html/2609.10702#S1.SS1) 2. 1\.2 研究背景与赛道规则 (https://arxiv.org/html/2609.10702#S1.SS2) 3. 1\.3 语言能力与学习行为评估 (https://arxiv.org/html/2609.10702#S1.SS3)1. 1\.3\.1 语言形式、知识与上下文使用 (https://arxiv.org/html/2609.10702#S1.SS3.SSS1) 2. 1\.3\.2 通过下游微调实现迁移 (https://arxiv.org/html/2609.10702#S1.SS3.SSS2) 3. 1\.3\.3 阅读行为与词汇习得 (https://arxiv.org/html/2609.10702#S1.SS3.SSS3) 4. 1\.4 综合评分与公开排行榜 (https://arxiv.org/html/2609.10702#S1.SS4) 5. 1\.5 主要挑战 (https://arxiv.org/html/2609.10702#S1.SS5) 6. 1\.6 性能提升与科学贡献 (https://arxiv.org/html/2609.10702#S1.SS6) 7. 1\.7 研究价值与未来应用 (https://arxiv.org/html/2609.10702#S1.SS7) 8. 1\.8 求是引擎执行的三个完整研究阶段 (https://arxiv.org/html/2609.10702#S1.SS8) 2. 2 阶段一:前沿推进 (https://arxiv.org/html/2609.10702#S2)1. 2\.1 选择表示、架构与目标 (https://arxiv.org/html/2609.10702#S2.SS1) 2. 2\.2 紧凑重述与预算再投资 (https://arxiv.org/html/2609.10702#S2.SS2) 3. 2\.3 残差结构与持续增量学习 (https://arxiv.org/html/2609.10702#S2.SS3) 4. 2\.4 后期训练中的连贯关系 (https://arxiv.org/html/2609.10702#S2.SS4) 5. 2\.5 原则发现的实验基础 (https://arxiv.org/html/2609.10702#S2.SS5) 3. 3 阶段二:原则发现 (https://arxiv.org/html/2609.10702#S3)1. 3\.1 关系类型塑造上下文使用 (https://arxiv.org/html/2609.10702#S3.SS1) 2. 3\.2 熟悉性能与在未见输入上的重用 (https://arxiv.org/html/2609.10702#S3.SS2) 3. 3\.3 监督分配如何改变关系学习 (https://arxiv.org/html/2609.10702#S3.SS3) 4. 3\.4 经验价值取决于预算、位移和学习状态 (https://arxiv.org/html/2609.10702#S3.SS4) 5. 3\.5 设计原则与独立发现 (https://arxiv.org/html/2609.10702#S3.SS5) 4. 4 阶段三:原则指导的模型改进 (https://arxiv.org/html/2609.10702#S4)1. 4\.1 从机制发现到训练决策 (https://arxiv.org/html/2609.10702#S4.SS1) 2. 4\.2 分离可见输入与监督目标 (https://arxiv.org/html/2609.10702#S4.SS2) 3. 4\.3 保留对普通输入的功能 (https://arxiv.org/html/2609.10702#S4.SS3) 4. 4\.4 两个延续起点的完整评估 (https://arxiv.org/html/2609.10702#S4.SS4) 5. 4\.5 习得与保留测量 (https://arxiv.org/html/2609.10702#S4.SS5) 6. 4\.6 模型测试如何完善原则 (https://arxiv.org/html/2609.10702#S4.SS6) 5. 5 研究谱系与独立发现 (https://arxiv.org/html/2609.10702#S5)1. 5\.1 模型继承与科学问题发展 (https://arxiv.org/html/2609.10702#S5.SS1) 2. 5\.2 经验压缩、替代与学习阶段 (https://arxiv.org/html/2609.10702#S5.SS2) 3. 5\.3 关系锚点、共享表示与可辨识性 (https://arxiv.org/html/2609.10702#S5.SS3) 4. 5\.4 实体存储、检索与语义寻址 (https://arxiv.org/html/2609.10702#S5.SS4) 5. 5\.5 优化、初始化与测量 (https://arxiv.org/html/2609.10702#S5.SS5) 6. 5\.6 保留完整的研究贡献 (https://arxiv.org/html/2609.10702#S5.SS6) 6. 6 讨论 (https://arxiv.org/html/2609.10702#S6)1. 6\.1 经验的价值与上下文依赖性 (https://arxiv.org/html/2609.10702#S6.SS1) 2. 6\.2 新能力与现有功能的共存 (https://arxiv.org/html/2609.10702#S6.SS2) 3. 6\.3 求是引擎如何组织和推进研究 (https://arxiv.org/html/2609.10702#S6.SS3) 4. 6\.4 研究RSI:研究过程的递归自我改进 (https://arxiv.org/html/2609.10702#S6.SS4) 5. 6\.5 可重用的贡献与进一步测试 (https://arxiv.org/html/2609.10702#S6.SS5) 7. 7 结论 (https://arxiv.org/html/2609.10702#S7) 8. A 训练、测量与可复现性 (https://arxiv.org/html/2609.10702#A1)1. A\.1 计算环境与实验支持 (https://arxiv.org/html/2609.10702#A1.SS1) 2. A\.2 模型版本、教师与数据来源 (https://arxiv.org/html/2609.10702#A1.SS2) 3. A\.3 习得与保留算法 (https://arxiv.org/html/2609.10702#A1.SS3) 4. A\.4 评估聚合、随机性与轨迹 (https://arxiv.org/html/2609.10702#A1.SS4) 9. B 完整的本地评估向量 (https://arxiv.org/html/2609.10702#A2) 10. C 附加控制与机制结果 (https://arxiv.org/html/2609.10702#A3)1. C\.1 下游微调随机性 (https://arxiv.org/html/2609.10702#A3.SS1) 2. C\.2 目标删除与源隔离 (https://arxiv.org/html/2609.10702#A3.SS2) 3. C\.3 测量人群与后续修正 (https://arxiv.org/html/2609.10702#A3.SS3) 11. D 公开排行榜指标 (https://arxiv.org/html/2609.10702#A4) 12. E 研究仓库与材料使用 (https://arxiv.org/html/2609.10702#A5) 13. F 研究主题与发现 (https://arxiv.org/html/2609.10702#A6) 14. 参考文献 (https://arxiv.org/html/2609.10702#bib) ## 1 BabyLM 2026:从有限数据中学习 大规模训练已经展示了语言模型能力可以随额外资源增长到何种程度。从有限文本中学习则提出了一个互补的问题:模型还能从其已有的经验中学到多少?一个更好的方法不仅要拟合这些文本。它还应该帮助模型使用相关信息、将所学应用于新的表达,并在训练继续时保留有用的能力。BabyLM为这个问题提供了共享的实验条件。本报告关注其Strict-Small赛道以及由求是引擎执行的完整研究计划:构建前沿模型、研究其行为背后的条件,并利用这些发现改进下一个模型。模型分数是一个成果。产生的方法和可检验的解释是另一个成果。 ### 1\.1 从有限数据中学习的科学问题 语言模型通过预测文本来学习。训练将模型的预测概率与实际出现的单词进行比较,通过损失函数衡量误差,并调整参数。在本报告中,*监督*指定了哪些预测对学习有贡献:一个目标是要被恢复的标记,一个目标位置标识了该标记发生的位置。重复的训练可以建立词汇、句法、语义和上下文的规律性。科学问题是哪些规律性真正支持正确的答案。假设一段文字说明钥匙从抽屉移到了一个盒子,后来的查询问钥匙现在在哪里。所需的计算使用了状态变化。一个依赖于“钥匙”和“抽屉”之间熟悉关联的模型,可能在没有学习该操作的情况下拟合许多普通句子。如果附近的单词通常揭示目标,训练就没有多少动机去查阅早期信息。遇到相关信息并学会使用它们是两个不同的成就。这种区分在数据稀缺时尤为重要。添加新段落、重复旧段落以及用不同的词语重述其内容都消耗训练预算,但不一定提供可互换的学习机会。重复可以巩固模式;重述可以改变其表达;新来源可以拓宽覆盖范围。它们的价值取决于模型当前的能力和剩余的训练预算。数据受限的缩放研究同样考察了重复暴露与非重复数据量及训练配置的联合影响\[1 (https://arxiv.org/html/2609.10702#bib.bib14)\]。数据高效语言建模研究如何更有效地使用有限的学习材料。参数数量、语料库大小、累计暴露和计算衡量不同的资源:容量、可用文本、重复呈现和执行成本。一个小模型可以反复阅读大量文本;一个更大的模型则可能经验有限。BabyLM的严格英语赛道同时约束了语料库和累计暴露,允许在共同的数据限制下比较方法。我们的核心问题是:什么训练经验教会模型使用上下文中的信息关系?什么允许这种能力在进一步学习中保持可用?我们使用*上下文依赖*来指代做出预测所需的上下文信息和关系。这个问题连接了语言习得、组合泛化——在新组合中使用已学习的元素——以及持续学习——在保留先前能力的同时获取新能力。自然文本、受控关系任务和完整的语言模型训练考察了这个问题的不同部分。 ### 1\.2 研究背景与赛道规则 BabyLM于2023年启动,到2026年进入其第四届,作为与EMNLP 2026相关的共享任务和研讨会。它通过训练数据、评估软件、基线模型和公开比较,汇聚了自然语言处理、计算认知科学和语言习得研究\[2 (https://arxiv.org/html/2609.10702#bib.bib19),3 (https://arxiv.org/html/2609.10702#bib.bib23)\]。早期版本在数据处理、模型设计和学习行为方面已建立了一系列工作\[4 (https://arxiv.org/html/2609.10702#bib.bib3)\]。它的价值不仅在于排行榜,更在于实验问题本身。对于机器学习,BabyLM提供了一个用于比较训练方法的可行环境。对于语言和认知,它提供了输入和学习轨迹可以被操控的模型。对于资源有限的研究团队,它使得从头训练和保留中间模型变得更加可行。该任务并不要求完全模拟儿童;它将从受限输入中学习作为共同的研究对象。2026年的赛道包括英语Strict-Small、英语Strict和多语言,涵盖英语、荷兰语和汉语。本报告的结果仅属于Strict-Small。两个英语预算级别总结在表1 (https://arxiv.org/html/2609.10702#S1.T1)中\[5 (https://arxiv.org/html/2609.10702#bib.bib4)\]。 表1:英语赛道的数据限制。词数遵循赛道规则,而非模型分词器。M表示百万,B表示十亿。语料库是可供训练的文本集合;累计暴露计算训练期间实际呈现的文本。阅读一篇千字文章十次,仍然使用一篇文章,但消耗一万词的曝光量。重写的文本、重复的段落以及用于保留现有行为的额外输入也必须根据适用规则进行统计。分词器将文本转换为称为标记的计算单元。由于一个词可能产生多个标记,分词器的计数不能替代赛道的词数。中间检查点——在连续训练量上保存的模型权重——对于评估学习轨迹是必需的。外部教师和辅助训练方法有额外的规则;仅满足最终词数不足以记录它们。附录A (https://arxiv.org/html/2609.10702#A1)记录了此处使用的数据、教师角色和训练设置。因此,评估既关乎最终分数,也关乎获得该分数的过程。固定的预算仍然留下了巨大的科学自由度。数据内容、表达、词汇、架构、目标、学习率、批量大小、呈现顺序和模型选择仍然是重要的选择。学习率控制参数更新的幅度;批量大小控制多少证据被合并。

相似文章

DeepSeek LLM:以长期主义扩展开源语言模型

Papers with Code Trending

DeepSeek LLM是一个开源语言模型项目,它开发了一个大规模数据集,并采用SFT和DPO,在各种基准测试和开放式评估中实现了超越LLaMA-2 70B和GPT-3.5的性能。