首届ChineseBabyLM挑战赛:面向中文的高数据效率与认知合理语言模型训练
摘要
本文宣布了将在NLPCC 2026上举办的首届ChineseBabyLM挑战赛。该挑战赛要求研究人员使用1亿中文词元从头训练语言模型,并在自然语言理解、认知对齐和汉字知识三个任务轨道上进行评估,旨在推动面向中文的高数据效率与认知合理的建模。
arXiv:2607.10745v1 公告类型:新
摘要:本文介绍了首届ChineseBabyLM挑战赛,该挑战赛将于2026年NLPCC会议上举办。挑战赛要求研究人员使用1亿中文词元从头训练语言模型,并在三个任务轨道上对模型进行评估:自然语言理解、认知对齐和汉字知识。对分词器、模型架构和训练轮数没有限制。挑战赛详情请见 https://chinese-babylm.github.io/。
查看缓存全文
缓存时间: 2026/07/14 04:22
# 面向中文的高效训练与认知合理语言模型 来源:https://arxiv.org/html/2607.10745 ## 首届中文BabyLM挑战赛:面向中文的高效训练与认知合理语言模型 宋思远∗¹ 钱志恒∗² 张云浩³ 何林阳⁴ 季晓哲⁵ 林颖欣⁶ 朱宏奥⁷ 邵崇天² 郎楚涵⁸ 李栾² 王睿² 胡仁芬⁵ 王少楠⁸ 胡海⁸ ¹普林斯顿大学;²上海交通大学;³中国科学院;⁴哥伦比亚大学;⁵北京师范大学;⁶清华大学;⁷加州大学圣迭戈分校;⁸香港理工大学 ∗:同等贡献 联系邮箱:[email protected]; [email protected]; [email protected]; ###### 摘要 本文介绍了首届中文BabyLM挑战赛,该赛事将在2026年NLPCC会议上举行。挑战赛要求参赛者用1亿中文token从头训练语言模型,并在三个任务轨道上评估模型:自然语言理解、认知对齐和汉字知识。对于分词器、模型架构和训练轮次没有限制。挑战赛详情请参见https://chinese-babylm.github.io/。 ## 1 引言 大型语言模型在许多语言理解任务上取得了强劲性能,但它们的成功通常依赖于使用超大规模语料库和大量计算资源进行预训练。这种数据密集型范式与人类语言习得形成鲜明对比:儿童从相对有限、自然主义的输入中习得强大的语言能力。BabyLM挑战赛旨在通过要求参赛者在受发展启发的数据预算下训练语言模型,使这种对比在实验上具有实用价值,从而鼓励对样本高效预训练、认知合理数据以及超越原始规模的评估协议进行研究(Warstadt等,2023b(https://arxiv.org/html/2607.10745#bib.bib3))。 最初的BabyLM共享任务主要关注英语。最近的多语言努力,如BabyBabelLM,将同样的动机扩展到更广泛的语言,表明应在类型学和正字法多样化的条件下研究数据高效的语言建模(Jumelet等,2026(https://arxiv.org/html/2607.10745#bib.bib2))。中文是一个特别重要的测试案例。它缺乏明确的词边界,广泛使用复合词,允许灵活的句法配置,并使用表意文字系统,其中汉字承载着视觉、结构和语音的规律性。这些特性使得中文语言学习不适合仅围绕字母表、空格分隔语言设计的评估协议,并引发了关于分词、字符级表示以及获取语言概括所需数据量的独特问题。 中文BabyLM挑战赛是一项研究中文数据高效和认知合理语言建模的共享任务。参赛系统必须从随机初始化的权重开始预训练,要么使用官方1.02亿词语料库(该语料库源自BabyBabelLM的中文部分(Jumelet等,2026(https://arxiv.org/html/2607.10745#bib.bib2))),要么在相同词预算内使用自行编译的语料库。这种设置保留了BabyLM的核心约束,同时允许参赛者探索不同的模型架构、分词器、数据选择策略和中文训练方法。 挑战赛从三个互补维度评估模型。自然语言理解轨道结合了零样本最小对评估(包括ZhoBLiMP(Liu等,2026(https://arxiv.org/html/2607.10745#bib.bib1)))和来自CLUE(Xu等,2020(https://arxiv.org/html/2607.10745#bib.bib18))的监督式中文理解任务。汉字轨道直接测试模型是否从有限输入中获取了关于汉字的结构和语音知识。认知建模轨道使用来自MulCogBench(Zhang等,2025(https://arxiv.org/html/2607.10745#bib.bib12))的中文fMRI基准,来衡量模型表示在词级和语篇级语言理解过程中预测人类神经反应的能力。这些轨道共同旨在奖励那些不仅在下游任务上准确,而且对中文特定语言结构敏感,并与认知动机评估标准相符的模型。 本文描述了首届中文BabyLM挑战赛的设计,包括训练规则、评估轨道、任务清单、基线系统和初步结果。通过提供标准化的语料库、开放的评估流程、隐藏的最终评估任务以及可复现的基线,该共享任务旨在支持围绕中文数据高效语言建模的研究社区,并为更广泛的BabyLM计划提供一个语言特定的对应部分。 ## 2 评估任务 中文BabyLM挑战赛从三个互补的语言能力维度评估数据高效的中文语言模型:自然语言理解、字符级知识和认知合理性。最终评估包括14个任务,分为三个轨道:八个自然语言理解(NLU)任务、四个汉字任务和两个认知建模任务。 #### 评估格式。 任务使用三种评估格式。首先,零样本最小对任务评估模型是否对一个合格或语义合理的句子 \(x^{+}\) 赋予比一个最小差异的不合格或不合理的句子 \(x^{-}\) 更高的分数。最小对任务的分数是准确率: \[ \frac{1}{N}\sum_{i=1}^{N}\mathbb{I}\left[s_{\theta}(x_{i}^{+}) > s_{\theta}(x_{i}^{-})\right], \] 其中 \(s_{\theta}(\cdot)\) 是由评估流程计算的模型分数。对于汉字任务,如果分词器无法识别目标汉字或汉字部件(UNK),则模型被视为在该最小对任务上失败。 其次,CLUE风格的NLU任务通过针对序列分类或多选分类的任务特定微调进行评估。 第三,认知建模任务评估模型表示是否能预测人类fMRI反应:模型隐藏状态被用作编码模型的特征,并将预测的神经反应与观察到的fMRI反应使用基于相关性的指标进行比较。 | 轨道 | 任务 | 拆分 | 最终文件大小 | 目标能力 | |------|------|------|--------------|----------| | NLU | ZhoBLiMP | 开放 | 35,400个最小对,来自118个范式 | 对中文语言最小对的零样本语法和语义判断。 | | NLU | XCOMPS-ZH | 隐藏 | 14,368个最小对 | 零样本概念-属性兼容性判断,测试模型是否偏好合理的概念-属性组合而非不合理的替代。 | | NLU | AFQMC | 开放 | 34,334条训练 / 4,316条开发记录 | 句子对语义相似度:预测两个中文句子或问题是否语义等价。 | | NLU | OCNLI | 开放 | 50,437条训练 / 2,950条开发记录 | 自然语言推理:将前提与假设之间的关系分类为蕴含、矛盾或中性。 | | NLU | TNEWS | 开放 | 53,360条训练 / 10,000条开发记录 | 来自中文新闻标题和相关文本的短文本新闻分类。 | | NLU | CLUEWSC2020 | 开放 | 1,244条训练 / 304条开发记录 | 中文Winograd风格共指消解:判断代词与候选名词短语是否共指。 | | NLU | C3 | 隐藏 | 11,869条训练 / 3,816条开发记录 | 多选中文机器阅读理解,涉及混合体裁段落和问题。 | | NLU | diagnostic_nli | 隐藏 | 50,437条训练 / 2,122条开发记录 | 诊断性自然语言推理,用于在保留的诊断集上探查推理行为。 | | Hanzi | hanzi_structure | 开放 | 2,000个最小对 | 字符级结构知识:评估模型是否捕捉到汉字部件和结构的规律性。 | | Hanzi | hanzi_structure_hidden | 隐藏 | 2,000个最小对 | 用于最终评估的保留字符结构最小对。 | | Hanzi | hanzi_pinyin | 开放 | 2,000个最小对 | 字符级语音知识:评估模型是否捕捉到汉字拼音相关的规律性。 | | Hanzi | hanzi_pinyin_hidden | 隐藏 | 2,000个最小对 | 用于最终评估的保留字符语音最小对。 | | Cog | word_fmri | 开放/隐藏 | 源fMRI数据集中的672个词刺激 | 脑对齐词级评估:将模型表示拟合到参与者阅读孤立中文单词时收集的fMRI反应。 | | Cog | fmri | 开放/隐藏 | 源fMRI数据集中的60个故事刺激,52,269个词 | 脑对齐语篇级评估:将模型表示拟合到参与者收听中文故事时收集的fMRI反应。 | 表1:中文BabyLM最终评估的任务清单。NLU和汉字任务的大小来自最终评估文件;Cog任务的大小描述了来自MulCogBench的相应中文fMRI刺激。 ### 2.1 自然语言理解轨道 自然语言理解轨道衡量中文的句法和语义理解。它包含两个零样本最小对任务和六个监督微调任务。最小对任务旨在测试预训练模型在无需任务特定训练的情况下,是否对一对话句中更可接受的那个赋予更高的概率或更低的伪困惑度。微调任务测试在BabyLM数据预算下学到的表示是否能迁移到标准的中文理解任务。 #### ZhoBLiMP。 ZhoBLiMP(Liu等,2026(https://arxiv.org/html/2607.10745#bib.bib1))是自然语言理解轨道中的开放零样本最小对基准。最终评估文件包含118个范式,每个范式有300个例子,总共35,400个最小对。每个项目对比一个可接受的中文句子与一个最小差异的不可接受句子。这些范式涵盖了广泛的中文句法和语义现象,包括“把”和“被”字句、量词-名词一致性、照应和约束、论元结构、被动结构、否定和自由选择极性项、正反问句和语气词问句、关系化、话题化、量化、词序以及情态或提升结构。在ZhoBLiMP上的性能计算为模型偏好可接受句子的比例。 #### XCOMPS-ZH(隐藏)。 XCOMPS-ZH是自然语言理解轨道中的隐藏零样本最小对任务(He等,2025(https://arxiv.org/html/2607.10745#bib.bib20))。它包含14,368个最小对,针对概念-属性兼容性。在每个对中,模型必须偏好一个语义兼容的概念-属性组合,而不是一个最小改动的不兼容组合。该任务通过强调常识类的语义兼容性而非主要是形态句法的可接受性,来补充ZhoBLiMP。 #### AFQMC。 AFQMC是来自CLUE(Xu等,2020(https://arxiv.org/html/2607.10745#bib.bib18))的一个句子对语义匹配任务。给定两个中文句子(通常是短用户查询),模型预测它们是否表达相同的意思。最终评估文件包含34,334条训练记录和4,316条开发记录。该任务评估释义识别和稳健的句子级语义比较。 #### OCNLI。 OCNLI是一个中文自然语言推理任务(Hu等,2020(https://arxiv.org/html/2607.10745#bib.bib17))。每个例子包含一个前提和一个假设,模型预测假设是否被前提蕴含、矛盾或中性。最终评估文件包含50,437条训练记录和2,950条开发记录。OCNLI评估句子对推理、词汇语义和组合推理。 #### TNEWS。 TNEWS是一个基于中文新闻标题的短文本分类任务(Xu等,2020(https://arxiv.org/html/2607.10745#bib.bib18))。模型从短输入文本预测新闻类别。最终评估文件包含53,360条训练记录和10,000条开发记录。该任务测试主题分类以及将中文短文本映射到粗粒度语义类别的能力。 #### CLUEWSC2020。 CLUEWSC2020是一个中文Winograd风格共指任务(Xu等,2020(https://arxiv.org/html/2607.10745#bib.bib18))。给定一个句子、一个代词和一个候选先行语,模型预测两个表达式是否共指。最终评估文件包含1,244条训练记录和304条开发记录。该任务针对语篇级推理、照应消解以及对决定指称的语义线索的敏感性。 #### C3。 C3是自然语言理解轨道中的隐藏机器阅读理解任务(Sun等,2020(https://arxiv.org/html/2607.10745#bib.bib19))。它是一个多选阅读理解基准,模型回答关于中文段落或对话的问题。最终评估文件包含11,869条训练记录和3,816条开发记录。与单句或句子对分类任务相比,C3更强调跨段落整合信息并从多个候选中选择最佳答案。 #### 诊断性NLI(隐藏)。 diagnostic_nli任务是一个隐藏的诊断性自然语言推理任务(Hu等,2021(https://arxiv.org/html/2607.10745#bib.bib16))。它遵循NLI格式,但设计用于最终保留的模型推理行为诊断。最终评估文件包含50,437条训练记录和2,122条开发记录。该任务用于探查在中文BabyLM数据预算下训练的模型是否学到超越开放开发任务的可推广推理模式。 ### 2.2 认知建模轨道 认知建模轨道评估模型表示是否与中文语言理解过程中的人脑反应对齐。两个任务源自MulCogBench(Zhang等,2025(https://arxiv.org/html/2607.10745#bib.bib12))的中文fMRI组件。在这两个任务中,评估流程提取模型表示,并拟合一个从这些表示到fMRI反应的编码模型。更好的预测性能表明模型表示中编码的语义信息与大脑在相应语言刺激下引起的神经表示中编码的信息更相似(Zhang等,2024(https://arxiv.org/html/2607.10745#bib.bib13))。 #### 词fMRI。 word_fmri任务是一个基于Wang等人(2022b(https://arxiv.org/html/2607.10745#bib.bib14))引入的中文词fMRI数据集的词级脑对齐基准。该数据集包含11名参与者在阅读672个孤立中文单词时的神经反应。该任务评估单个词的表示是否编码了能够预测词理解过程中fMRI反应空间模式的信息。因此,该任务探查相对局部的词汇和语义表示。 #### 语篇fMRI。 fmri任务是一个基于Wang等人(2022a(https://arxiv.org/html/2607.10745#bib.bib15))引入的中文语篇fMRI数据集的语篇级脑对齐基准。该数据集包含12名中文母语者在收听60个故事(共52,269个词)时的神经反应。与词级任务相比,该任务在更自然、上下文更丰富的理解环境中评估表示。它测试模型是否编码了在长时间语言加工过程中预测神经活动有用的信息。
相似文章
探索大语言模型在中文抽象语言掌握中的能力边界
本文介绍了Mouse基准测试,用于评估大语言模型在六个自然语言处理领域的中文抽象语言任务表现。研究表明,尽管当前最先进的模型在上下文理解任务中表现良好,但在这种亚文化网络语言上仍存在重大局限。
评估大型语言模型中的中文歧义理解能力
本文介绍了基于潜在歧义理论的汉语歧义数据集CHA-Gen,并评估了多个LLM在歧义检测任务上的表现。研究发现,模型虽然面临挑战,但通过思维链提示有所改进,而指令调优则导致过度自信。
基于迁移学习与数据增强的低资源汉语方言辨识
本文提出了一种新颖的框架(CDDTLDA),利用迁移学习和数据增强技术,在低资源条件下提升汉语方言辨识能力,并在两个基准语料库上取得了最先进的结果。
一种以人为本的大语言模型育儿建议基准测试方法
本文提出了一种以人为本的基准测试方法,用于评估大语言模型在育儿建议方面的表现,使用专家制定的评分标准,在英语和中文中评估了15个大语言模型在100个场景下的表现。
@Pavel_Izmailov: 新论文:潜在上下文语言模型(LCLMs)!思想:将16个token编码为1个潜在token,让LLM处理t…
介绍潜在上下文语言模型(LCLMs),该模型将16个token编码为1个潜在token,以提高性能、速度和内存使用。