标签
本文宣布了将在NLPCC 2026上举办的首届ChineseBabyLM挑战赛。该挑战赛要求研究人员使用1亿中文词元从头训练语言模型,并在自然语言理解、认知对齐和汉字知识三个任务轨道上进行评估,旨在推动面向中文的高数据效率与认知合理的建模。