儿童在语言学习上超越了人工智能——而我们仍然不知道原因

MIT Technology Review 新闻

摘要

儿童学习语言所需的数据远少于像LLMs这样的AI模型,理解这种数据效率差距可能导致更高效的AI系统和对人类认知的洞察。

<p>据我们所知,人类彼此交谈已有至少10万年。在如此漫长的时间里,世界上只有一样东西能够学习人类语言并达到完美的流利程度:人类的孩子。&nbsp;</p> <p>现在有两种了。&nbsp;</p> <p>ChatGPT发布仅短短四年,我们许多人现在已习以为常地能用手机或计算机自然地进行对话。像Claude、DeepSeek和OpenAI的GPT模型这样的LLMs足够流利和灵活,能够令人信服地伪装成人类。但掀开计算的帷幕,却发现了一个问题:教计算机使用人类语言仍然需要海量的数据。一个LLM可以轻松处理比一个人掌握母语过程中经历的多出十万倍的词汇——远超过儿童在一岁生日前可能听到的词汇量,而那通常是他们开始掌握语言的时候。</p> <p>斯坦福大学的认知科学家Michael C. Frank说:“最近的进展令人惊叹,但我们仍然需要烧毁一片森林、刮取人类全部知识的总和,来重现发生在我们客厅里、历时一年的这一里程碑。”</p> <p>儿童与机器之间的这种巨大鸿沟被称为数据效率差距。它为认知科学家提出了一个诱人的问题,也为AI模型的构建者带来了挑战:为什么儿童仍然能够超越有史以来最复杂的语言机器?</p> <p>寻找答案对AI研究和认知科学都至关重要。过去十年,语言模型主要通过变得更大来改进。两年前发布的Meta开源权重LLM Llama 3.1,在预训练中处理了15万亿个token——预训练是模型在为特定任务(如聊天机器人)进行微调之前的主要训练步骤。乔治城大学的认知科学家和语言学家Ethan Gotlieb Wilcox表示,前沿模型可能正在用十倍更多的数据进行预训练。但互联网上的可训练数据是有限的,最终——可能最早在21世纪30年代——易于获取的数据源可能会枯竭。</p> <p>儿童表明,有可能用更少的数据学习更多,甚至少得多。在一个语言丰富的家庭中长大的12岁儿童,可能已经听到了大约1亿个词汇。再加上识字能力,到20岁时词汇量可能增加到约3亿个。</p> <p>规模上的差异只能通过类比来大致说明。Wilcox说:“Claude看到的语言量相当于一个城市一代人所经历的所有语言。”如果将现代LLM训练中使用的所有词汇打印在纸上,你可以堆叠到超过国际空间站的高度。而12岁儿童的1亿词汇只能堆叠20米高。而我们可以用远少于这个数量的语言来学习。</p> <p>通过逆向工程儿童的学习方式,科学家希望创建更数据高效的AI模型,这可能在从有效训练视频AI到为少数语言社区创建聊天机器人等方面都有用处。在机器模型中测试关于人类学习的假设,也可能解决关于语言和儿童发展思维的持久问题。我们是否天生具有语言本能,或者即使从理论上讲,儿童是否可能纯粹从经验中学习语言?我们处理语言的方式是否是我们生物学的特例,或者至少部分反映了语言如何使用和学习的普遍约束?</p> <h3 class="wp-block-heading">核心要素</h3> <p>我们大多数人只有在成年后尝试学习新语言时才意识到语言的难度。过去完成时、卷舌R音和鼻化元音、所有格、短语动词、语法上阳性的桌子和阴性的勺子——对成年语言学习者来说,许多都是语言折磨的工具。然而,学习母语通常毫不费力。幼儿通常在听到约1000万个词汇后开始产出语法正确的句子,最高可达3000万。</p> <p>Frank说:“这完全是奇迹。如果你用3000万个词汇训练GPT-2,你会得到一个胡言乱语的生成器,而不是一个孩子。”</p> <p>婴儿究竟如何做到这一点仍然是个谜。研究人员对儿童在不同发展阶段学习什么以及如何使用语言有很多了解,但仍然有很多未知之处。或许最持久的问题是婴儿为什么能够学习语言。人类语言的句法——将单词组合成句子的规则——包括递归和嵌套结构,这使我们能够用有限的词汇和词素表达几乎无限的想法。这对婴儿来说似乎应该是个问题。他们只在语言深不可测的海洋中嬉戏于浅滩。然而,不知何故,这就足够了。从一滴水中,他们推断出深度。</p> <p>20世纪50年代麻省理工学院语言学家Noam Chomsky提出的一种解决方案是,婴儿天生具有语法的硬编码知识。Chomsky是对心理学家B.F. Skinner所倡导的一种对立观点的回应,后者认为语言习得完全基于环境。Skinner认为语言是通过条件作用和强化学习的,就像狗学会如何坐下或握手换零食一样。Chomsky以“刺激的贫乏”来反驳——语言,尤其是句法,太复杂,儿童对其的接触太“贫乏”,无法完全从经验中学习。加州大学尔湾分校的语言学家和认知科学家Richard Futrell说:“他的核心论点本质上是,语言不能纯粹基于统计来学习。”相反,Chomsky假设语言基于一套逻辑规则,并认为儿童需要这些规则的先天知识,才能从零碎的言语中推断出他们语言的语法。</p> <blockquote class="wp-block-quote is-layout-flow wp-block-quote-is-layout-flow"> <p style="font-size:30px"><strong>“这完全是奇迹……如果你用3000万个词汇训练GPT-2,你会得到一个胡言乱语的生成器,而不是一个孩子。”</strong></p> <cite>Michael C. Frank, cognitive scientist, Stanford University</cite></blockquote> <p>Chomskyan的语言观在美国语言学界以生成语法的名义统治了数十年。它在20世纪50年代和60年代对计算机科学产生了重大影响,当时AI正处于第一次繁荣期,语言学和自然语言处理之间的界限在大量军事资金下消融;五角大楼希望计算机能够理解英语和翻译俄语。</p> <p>尽管简单的神经网络在早期取得成功,它们能够学习识别和复制统计模式,但美国的AI研究人员大体上采用了受Chomsky理论影响的基于规则的框架。他们试图通过在程序中明确编码规则来教计算机语言——可以想象,这更像是语法课而不是沉浸式体验。这种方法是更广泛的趋势——符号AI的一部分,持续了数十年。它也大体上未能产生实际能够大规模处理人类语言的模型。对自然语言处理的兴趣在始于20世纪70年代的“AI寒冬”中降温。</p> <p>之后,神经网络开始复苏。但直到20世纪10年代,当计算机硬件变得便宜且功能强大,互联网也变得庞大时,它们的性能才开始
查看原文
查看缓存全文

缓存时间: 2026/08/24 10:06

# 儿童语言学习能力超越AI——原因仍成谜 来源:https://www.technologyreview.com/2026/08/24/1141740/kids-machines-language-learning 大语言模型需要比儿童多得多的数据来学习语言。理解其中原因可能帮助我们创造更高效的模型,并揭示更多关于心智发展的奥秘。 人类相互交谈的历史至少可追溯到十万年前。纵观这段漫长岁月,世界上只有一种生物能完美掌握人类语言:人类孩童。 如今,这个名单上多了第二种。 ChatGPT发布仅四年后的今天,我们许多人已习以为常地用手机或电脑进行自然对话。Claude、DeepSeek以及OpenAI的GPT系列等大语言模型,其语言流畅度与灵活性已足以令人信服地模拟人类对话。但揭开计算过程的幕布,仍存在一个关键问题:让计算机使用人类语言,依然需要超乎人类规模的数据量。一个大语言模型轻松处理的文字量,可达人类掌握母语过程所接触文字的十万倍——远超儿童通常在一岁生日前(即语言能力萌芽期)所听到的语音量。 “近期的进步确实惊人,”斯坦福大学认知科学家迈克尔·C·弗兰克如此评价大语言模型,“但我们仍需焚烧整片森林、获取全部人类知识,才能复现每个家庭客厅里在一年间自然发生的这个里程碑。” 这种儿童与机器间的巨大鸿沟被称为“数据效率鸿沟”。它为认知科学家提出了诱人问题,也为AI模型构建者带来了挑战:为何儿童的语言能力至今仍优于史上最精密的语言机器? 寻找答案对人工智能研究与认知科学都至关重要。过去十年,语言模型主要依靠规模扩张取得进步。两年前发布的Meta开源模型Llama 3.1,在预训练阶段消化了15万亿个词元(https://github.com/meta-llama/llama-models/blob/main/models/llama3_1/MODEL_CARD.md)(类似单词的语言单元)。这是针对特定任务(如聊天机器人)微调前的主要训练阶段。乔治城大学认知科学家兼语言学家伊桑·戈特利布·威尔科克斯指出,前沿模型的预训练数据量可能达到现有模型的十倍。然而互联网数据终归有限,或许最早在2030年代,可用数据的泉眼就将枯竭。 儿童的学习能力表明,我们有可能用更少的数据掌握更多知识。在一个语言环境丰富的家庭中成长的青少年,可能听过约1亿个词汇。若算上阅读能力,到20岁时其接触词汇量或许能达到3亿。 规模差异之大只能通过类比来体会。“Claude处理过的语言量相当于一座城市一整代人接触的语言总量,”威尔科克斯说道。若将训练现代大语言模型的所有文字打印出来,堆叠高度将超过国际空间站。而人类青少年的1亿词汇量,堆起来仅约20米。实际上我们可以用更少的数据实现语言学习。 通过逆向工程解析儿童的学习机制,科学家希望创造数据效率更高的AI模型。这种模型可能应用于诸多领域:从高效训练视频AI,到为少数语言社区创建聊天机器人。在机器模型中验证人类学习假说,也有助于解答关于语言和儿童心智发展的长期疑问:我们是否天生具有语言本能?儿童能否纯粹通过经验习得语言?我们处理语言的方式是生物学的特殊产物,还是反映了语言使用与学习的普遍约束? ### 核心要素 多数人直到成年后学习新语言时,才意识到语言学习的难度。过去完成时、颤音r和鼻元音、属格、短语动词、语法上分阳性的桌子与阴性的勺子——这些是成年语言学习者面临的重重磨难。但学习母语通常毫不费力。幼儿通常在听过约1000万词汇(最多3000万)后,就能开始说出语法正确的句子。 “这简直是奇迹,”弗兰克表示,“若用3000万词汇训练GPT-2,你只会得到胡言乱语生成器,而非一个孩童。” 婴儿如何做到这点仍是谜。研究者虽已深入了解儿童在不同发展阶段的学习内容与语言使用方式,但仍有诸多未解之谜。其中最持久的问题是:婴儿究竟为何能够学会语言?人类语言的句法——将单词组合成句子的规则——包含递归和嵌套结构,使我们能用有限的词汇和语素表达近乎无限的思想。这对婴儿而言看似难以逾越的障碍。他们只是在语言深海中浅滩嬉戏。然而不知何故,这已足够。他们从一滴水中推知深海。 麻省理工学院语言学家诺姆·乔姆斯基在1950年代提出的解释是:婴儿天生内置语法知识。乔姆斯基此举是针对心理学家B.F.斯金纳的对立观点——后者认为语言习得完全源于环境。斯金纳将语言学习视为条件反射与强化过程,如同狗通过训练学会坐下或握手。乔姆斯基则以“刺激贫乏论”反驳:语言(尤其是句法)过于复杂,而儿童接触的语言环境又过于“贫乏”,不足以让他们仅凭经验完成学习。“他的核心论点实质是:语言不能单纯基于统计来学习,”加州大学尔湾分校的语言学家兼认知科学家理查德·弗特雷尔指出。乔姆斯基因此假设语言基于一套逻辑规则,并认为儿童需要先天具备这些规则的知识,才能从零散的语言片段中推导出母语语法。 > **“这简直是奇迹……若用3000万词汇训练GPT-2,你只会得到胡言乱语生成器,而非一个孩童。”** > 斯坦福大学认知科学家 迈克尔·C·弗兰克 乔姆斯基的语言观以生成语法之名主导美国语言学界数十年,并在1950-60年代深刻影响计算机科学。彼时AI正经历首次繁荣,语言学与自然语言处理在军方资金浪潮中交融——五角大楼希望制造能理解英语、翻译俄语的计算机。 尽管早期能识别和复制统计模式的简单神经网络取得成功,美国AI研究者主要采纳了受乔姆斯基理论影响的规则框架。他们试图通过将规则显式编码进程序来教授计算机语言——这更像是语法课而非沉浸式学习。这种符号AI的一部分方法论盛行数十年,但未能真正造出能大规模处理人类语言的模型。随着1970年代开始的“AI寒冬”,自然语言处理研究热度骤降。 此后神经网络开始复苏。但直到2010年代,计算机硬件变得廉价且强大,互联网规模急剧扩大,神经网络性能才开始惊艳世界。2018-2019年,基于新型Transformer架构、在数十亿词元上训练的BERT和GPT-2模型向业界揭示:从海量数据中学习对语言同样有效。2022年OpenAI聊天机器人ChatGPT的爆发式成功,让所有人看清了这点。 大语言模型并非人脑。它们是强大的统计学习器——没有任何进化赋予的人类皮层生物特性的朴素模式学习机器。换言之,它们恰恰是二十年前生成语法学家认为*不可能*学会语言的那类事物。然而如今它们却能写出令人信服的诗歌,通过语法测试。 “无论你对AI持多大怀疑,最令所有人惊叹的是:这些机器学会了语法,”加州大学伯克利分校发展心理学家艾莉森·戈普尼克说,“我原以为这不会成真。我认为多数人也不认为仅通过分析大量语言样本的统计特征就能掌握语法。” 但若是从*少量*语言样本学习——比如儿童接触到的量呢?能否构建出不只是胡言乱语生成器的婴儿规模模型? ### 婴儿语 加州大学圣迭戈分校语言学家兼数据科学家亚历克斯·沃施塔特,将BERT和GPT-2发布的那几年称为令人振奋的时代。2019年,他还是纽约大学语言学博士生,目睹着自己领域在眼前变革。语言模型能通过消化文本学习英语这一事实本身,就是对主流乔姆斯基思想的挑战。但许多语言学家仍怀疑大语言模型能否揭示人类语言习得机制。 “我总在一个问题上遭到反对:模型的数据规模,”沃施塔特说,“当人们在人类尺度数据上训练语言模型时,从未让业界为之惊艳。” 但沃施塔特在大语言模型中看到了潜力:科学模型不必完美才具有启发性,而大语言模型显然是人类语言使用的强大模拟器。通过将儿童学习假说融入模型并评估其表现——衡量它们多接近填补数据鸿沟——科学家能否借此检验自己的想法?2022年8月,沃施塔特在Twitter线程(https://www.aclweb.org/portal/content/chinese-babylm-challenge)中阐述观点:神经网络或可成为语言习得的有效模型。在与AI研究者莱舍姆·乔申的讨论中,沃施塔特提出了后来发展为BabyLM的构想——这项年度竞赛由沃施塔特、乔申及其他研究者组织,旨在用小数据集训练模型。 至今已过去四年。BabyLM已增设研讨会并衍生出专项竞赛,包括针对中文的婴儿模型比赛(https://www.aclweb.org/portal/content/chinese-babylm-challenge)。主赛事要求研究者在“符合发展规律”的语料库上训练模型,该语料库仅包含1亿词汇(幼儿规模赛道为1000万),素材源自故事书、对话、电影字幕、简易维基百科、普通维基百科及面向儿童的真实语音转写。组织者之一的威尔科克斯介绍,模型将接受心理语言学家用于人类测试的语法基准评估。 一种任务范式是向测试对象(人类或机器)呈现句子,观察其对不合语法特征的困惑或惊讶反应。例如,测试可能对比“橱柜钥匙*是*在桌子上”与“橱柜钥匙*在*桌子上”。威尔科克斯解释:“当人类看到‘是’时会想:*这不该用‘是’*。”对人类而言,这种惊讶可通过眼动追踪测量;对语言模型则使用“意外值”指标,评估模型预测某个句子或片段出现的概率。 竞赛已挑战某些假设,例如课程学习的有效性(https://aclanthology.org/2025.babylm-main.28/)。课程学习从简单训练数据开始,逐步过渡到复杂输入——类似从婴儿语开始逐渐提升难度。沃施塔特指出,这确实是首轮BabyLM中最主流的方法,但效果未达预期。 “这方法确实难以抗拒。课程学习看起来与我们设想的人类学习方式高度契合,”波士顿大学计算机科学家、BabyLM组织者亚伦·穆勒表示,“但Transformer模型似乎并不真正需要数据按特定顺序排列才能有效学习。” 颇具讽刺意味的是,最佳BabyLM模型并非受婴儿启发。2024年的冠军GPT-BERT是混合模型:部分架构像现代大语言模型般预测序列中的下一个词元,部分架构则模仿BERT这类“掩码语言模型”,以“填词游戏”方式补全词元序列。值得注意的是,当GPT-BERT在约1亿词汇上预训练后,其在某项BabyLM基准测试中的表现甚至超越了在近1.5万倍数据上预训练的Meta Llama 2 70B模型。 尽管如此,BabyLM模型仍远不及大语言模型。许多模型甚至无法生成文本,即使是GPT-BERT,与现代商用模型相比也显得笨拙。从根本上说,虽然这些模型具有“婴儿级”数据量,但其学习方式与婴儿差异显著。儿童并非脱离实体的计算机程序——他们的唯一“体验”并非来自文字。他们通过感官(尤其是视觉和听觉)感知世界。部分研究者认为,要缩小数据鸿沟,机器需要开始像儿童那样通过眼睛和耳朵学习。 ### 吸收一切 约15年前迈克尔·弗兰克在斯坦福建立实验室时,科学家尚不了解婴儿如何体验世界。发展心理学家刚开始通过头戴摄像头窥见婴儿生活的片段。 “早期研究的洞见在于:儿童体验与我们想象的截然不同,”弗兰克说,“他们的世界更为聚焦:小短手只能触及近在咫尺的物体,他们生活在由膝盖构成的森林中。” 弗兰克兴奋地想用头戴摄像头影像训练机器学习模型,以检验儿童语言学习假说,但他需要更多数据。于是他与四位同事招募了三名婴儿(均为心理学家母亲的孩子,清楚自己参与的研究),为科学戴上头戴摄像头。这个名为SAYCam(https://direct.mit.edu/opmi/article/doi/10.1162/opmi_a_00039/97495/SAYCam-A-Large-Longitudinal-Audiovisual-Dataset)的项目,记录了每个孩子6个月到2岁半期间每周两小时的生活。 “家庭愿意公开这些视频,这至关重要,”弗兰克说,“所以我们公开了数据,人们开始用它训练模型。” 普林斯顿大学认知科学家兼AI研究员布伦登·莱克就是其中一位。2024年,当他任职于纽约大学时,他与同事展示了一个用61小时原始SAYCam数据训练的模型(https://www.science.org/doi/full/10.1126/science.adi1374),该模型能识别物体并将其与词汇关联。发展心理学的许多理论认为,儿童需要某些先天倾向来帮助他们从原始感官体验中筛选特定部分,并将其与语言符号关联...

相似文章

The Download:儿童超越AI学习,及太空旅行代理

MIT Technology Review

本文突出了儿童在学习上超越AI模型的数据效率差距,探讨了缩小这一差距的研究,并涵盖了太空旅行中的新兴职业,以及其他科技发展,如AI数据中心的反对和人形机器人的记录。

AI并不比婴儿更聪明——尚未

Wired

一项新的基准测试EgoBabyVLM挑战AI视觉语言模型,要求它们从婴儿头戴摄像头拍摄的视频中学习,结果显示当前的AI模型无法匹敌婴儿的学习效率,并表明类似婴儿的学习架构可能带来更高效的AI。