AI 见闻
精选· 重要性 4/5

儿童学习语言效率远超AI,数据效率差距成研究焦点

MIT Technology Review — AI··Elise Cutts·约 8 分钟阅读
中文导读

儿童学习母语所需的数据量远少于大语言模型,这一数据效率差距引发认知科学与AI研究的交叉关注,或推动更高效AI模型的开发。

孩子们比人工智能学得更好——我们仍然不知道为什么。据我们所知,人们互相交谈至少已有10万年的历史。而在这漫长的时间里,世界上只有一种东西能够将人类语言学到完美流利的程度:人类的孩子。现在,有了两种。

ChatGPT发布短短四年后,我们中的许多人已经习以为常地认为,与手机或电脑自然交谈是理所当然的。像Claude、DeepSeek和OpenAI的GPT模型这样的LLM,其流畅度和灵活性足以令人信服地伪装成人类。

但揭开计算帷幕,会发现一个问题:教计算机使用人类语言,仍然需要非人的数据量。一个LLM轻松处理的语言量,可能是一个人在掌握母语过程中所经历词汇的十万倍以上,也远超儿童在一岁生日前(通常开始掌握语言时)所听到的词汇量。

斯坦福大学认知科学家Michael C. Frank谈到LLM时说:“最近的进展令人惊叹。但我们仍然需要烧毁一片森林,耗尽所有人类知识的总和,才能重现我们客厅里一年内发生的这一里程碑。”儿童与机器之间的这种巨大鸿沟,被称为数据效率差距。

这给认知科学家提出了一个诱人的问题,也给AI模型的设计者带来了挑战:为什么孩子们仍然能超越有史以来语言能力最复杂的机器?寻找答案对AI研究和认知科学都至关重要。过去十年,语言模型大多通过变得更大而变得更好。

Meta的开放权重LLM Llama 3.1(两年前发布)在预训练中消耗了15万亿个token(类似单词的语言块)——这是训练模型的主要步骤,发生在针对特定任务(如聊天机器人)进行微调之前。

乔治城大学的认知科学家兼语言学家Ethan Gotlieb Wilcox表示,前沿模型可能在10倍以上的数据上进行预训练。但可供训练的互联网数据是有限的,最终——也许早在2030年代——容易获取的数据之井可能会枯竭。

孩子们表明,用更少的数据可以学到更多,而且少得多。一个在语言丰富家庭长大的青少年可能听过大约1亿个单词。再加上读写能力,到20岁时,这个数字可以增加到约3亿个单词。这种规模上的差异只能通过类比来体会。

Wilcox说:“Claude所见的语言量,相当于整个城市一代人经历的语言量。”

如果你把用于训练现代LLM的所有单词打印在纸上,堆叠起来可以超过国际空间站的高度。而人类青少年听到的1亿个单词,堆起来只有20米。而且我们还能用更少的。

通过逆向工程孩子们的学习方式,科学家希望创造出数据效率更高的AI模型,这可以用于从在视频上有效训练AI到创建服务少数语言社区的聊天机器人等各个方面。在机器模型中测试关于人类学习的假设,也可能解决关于语言和儿童思维发展的长期问题。

我们是天生就有语言本能,还是即使原则上,孩子也可能纯粹从经验中学习语言?我们处理语言的方式是生物学的怪癖,还是至少部分反映了语言使用和学习的普遍约束?基本要素。我们大多数人只有在童年之后尝试学习一门新语言时,才会意识到语言有多难。

过去完成时、卷舌的r、鼻元音、属格、短语动词、语法上阳性的桌子和阴性的勺子——这些都是成年语言学习者遭受语言折磨的工具。然而,学习母语通常毫不费力。幼儿通常在听到大约1000万个单词(高端为3000万)后,就开始产生语法正确的句子。

“这简直是个奇迹,”Frank说。“如果你用3000万个单词训练GPT-2,你得到的是一个胡言乱语生成器;你不会得到一个孩子。”婴儿究竟如何做到这一点,是个谜。研究人员对孩子们在不同发展阶段学习什么以及如何使用语言了解很多,但仍有许多未知。

也许最持久的问题是为什么婴儿能学会语言。人类语言的句法——将单词组合成句子的规则——包括递归、嵌套的结构,使我们能用有限的词汇和词素表达几乎无限的想法。这似乎对婴儿来说是个难题。他们只是在无垠语言海洋的浅滩上嬉戏。

然而,不知何故,这已经足够了。他们从一滴水中推断出深度。麻省理工学院语言学家诺姆·乔姆斯基在20世纪50年代提出的一个解决方案是,婴儿天生就具有语法的硬接线知识。乔姆斯基是对心理学家B.F.斯金纳所倡导的相反观点的回应,斯金纳认为语言习得完全是环境性的。

斯金纳认为语言是通过条件作用和强化学习的,就像狗学会坐下或摇尾巴以获取食物一样。乔姆斯基反驳时引用了“刺激的贫乏”——即语言,尤其是句法,过于复杂,而儿童接触到的语言过于“贫乏”,无法完全从经验中学习。

加州大学欧文分校的语言学家兼认知科学家Richard Futrell说:“他的标志性论点基本上是,语言不能纯粹基于统计来学习。”相反,乔姆斯基认为语言基于一套逻辑规则,并主张儿童需要对这些规则的先天知识,才能从言语碎片中推断出他们语言的语法。

“这简直是个奇迹……如果你用3000万个单词训练GPT-2,你得到的是一个胡言乱语生成器;你不会得到一个孩子。”——Michael C. Frank,斯坦福大学认知科学家。乔姆斯基的语言观以生成语法的名义统治了美国语言学数十年。

它对20世纪50年代和60年代的计算机科学产生了重大影响,当时AI正处于第一次繁荣期,语言学与自然语言处理之间的界限在大量军事资金的洪流中消融;五角大楼想要能理解英语和翻译俄语的计算机。

尽管早期简单的神经网络(能学习识别和重现统计模式)取得了成功,但美国AI研究者大体上采用了受乔姆斯基理论影响的基于规则的框架。他们试图通过将规则显式编码到程序中来教计算机语言——想想更少的沉浸式体验,更多的语法课。

这种方法,作为称为符号AI的更广泛趋势的一部分,盛行了几十年。

它也在很大程度上未能产生真正能够大规模处理人类语言的模型。在20世纪70年代开始的“AI寒冬”中,自然语言处理的兴趣冷却了。此后,神经网络开始卷土重来。但直到2010年代,当计算机硬件变得便宜且强大,互联网变得庞大时,它们的性能才开始引人注目。

到2018年和2019年,基于新架构Transformer构建并在数十亿token上训练的模型BERT和GPT-2,让内部人士清楚,从海量数据中学习可以适用于语言。2022年,随着OpenAI聊天机器人ChatGPT的突破性成功,所有人都明白了。

LLM不是大脑。它们是强大的统计学习者——天真的模式学习机器,没有融入任何进化出的生物怪癖。

原文出处
Kids outlearn AI—and we still don’t know why

本文为机器翻译辅以 AI 润色,仅供参考。原始事实以原文为准。

相关阅读