AI 见闻
精选· 重要性 4/5

婴儿式学习:AI 效率提升的新方向

Wired — AI··Will Knight·约 5 分钟阅读
中文导读

研究人员开发出 EgoBabyVLM 测试,发现当前最先进的 AI 模型在理解婴儿视角的世界时表现糟糕,这提示婴儿大脑的高效学习机制可能为构建更节能、更自然的 AI 提供关键启示。

如果你认为在数千块尖端芯片上运行的人工智能模型很聪明,那让我给你介绍一下 1 岁婴儿的概念。好吧,婴儿可能不会写程序、解高等数学或辩论哲学。

但与消耗海量训练数据和巨量能源的 AI 模型不同,婴儿以惊人的效率学习理解世界:他们看一两次就能识别新物体,通过短暂的观察和身体互动来学习。在改进 AI 方面,婴儿及其大脑结构可能蕴含着关键洞见。

构建更像婴儿的 AI 版本可以降低前沿模型的成本和能耗,如果 AI 驱动的机器人要以更自然的方式学习环境,这也很有价值。

为了探索这一前沿,Meta、斯坦福大学、东京大学和法国巴黎高等师范学院的研究人员开发了一项新测试,突出婴儿的学习技能,并推动 AI 研究人员设计与之匹配的算法。EgoBabyVLM 挑战赛评判视觉语言模型(VLM)如何理解婴儿所看到的世界。

该测试要求模型在摄入约一千小时从婴儿和幼儿头部摄像头采集的视频后描述世界。(没错,真的。)结果发现,当输入这些真实而混乱的镜头时,最先进的模型表现糟糕,这表明婴儿大脑的设计可能有所不同,使其能从极少信息中快速学习。

婴儿并非从精心策划的数据集中学习,而是从万花筒般的视角中学习:父母谈论已不在视野中的物体,用目光或手势指示事物,讨论过去或未来的事件,而非当下发生的事情。

斯坦福大学专攻语言学习的认知科学家 Michael Frank 参与了 EgoBabyVLM 的开发,他表示婴儿不仅从语言中学习,还从丰富的多模态和触觉体验中学习。该测试表明,对于 AI,“显然需要的不仅仅是语言,”Frank 说。

值得注意的是,基于 Transformer 的 AI 模型——通过关注不同句子中词语之间的关系来处理语言——可以很好地完成语言学习任务,这一发现挑战了 Noam Chomsky 关于语法可能硬连线在人脑中的观点。

首先开发 BabyLM 的苏黎世联邦理工学院语言学家 Ryan Cotterell 表示,在理解物理世界方面情况不同。“不会有大量的人类互动语料库——没有人类互动的互联网,”他说。

麻省理工学院的认知科学家 Joshua Tenenbaum 指出,BabyLM 显示模型并未获得关于物理世界、社会动态或心智理论的“常识”。

“Transformer 非常擅长在数据中寻找模式,”Tenenbaum 说,“但纯模式学习系统似乎无法像婴儿或儿童那样接收数据并学习他们所做的一切。”一个长期存在的问题是,进化是否找到了优化人类和其他动物某些学习技能的方法,还是简单的学习算法就能完成我们所做的一切。

“认知科学和神经科学中关于大脑在进化中内置了多少内容存在很多争论,”Tenenbaum 说,“大脑极其复杂,有很多内置的结构和架构。”

2024 年,研究人员表明,一个基本的 VLM 仅通过消费单个婴儿头部记录的数据就能学习简单事物,比如什么是球。但这距离以复杂方式推理世界还有很长的路要走。

“谜团在于儿童如何在 2 岁时就获得他们拥有的全部能力,”参与该项目的普林斯顿大学认知科学家 Brendan Lake 说。EgoBabyVLM 论文的作者建议,借鉴认知科学和神经科学的不同想法可以推动向更类人学习算法的进展,包括设计能够更长时间关注并解读社交线索的模型。

斯坦福大学的 Frank 已经证明新方法可以让我们更接近婴儿般的 AI。今年早些时候,他和同事测试了一种新型模型,该模型擅长使用相同的婴儿头部视频数据学习因果关系以及视觉和时间关系——即物体如何随时间相互影响。

他们发现新模型能够更有效地学习不同物体的动力学,这是物理推理的基础。这是一个诱人的可能性:或许那些偏向于更快学习物理和社会关系等知识的模型整体上可能成为更高效的学习者。

“EgoBabyVLM 是一个精彩的挑战,”Lake 说,“我很期待看到研究人员会提出哪些新架构、方法和要素。”

本文是 Will Knight 的 AI Lab 新闻通讯的一期。在此阅读往期通讯。

原文出处
AI Isn’t Smarter Than a Baby—Yet

本文为机器翻译辅以 AI 润色,仅供参考。原始事实以原文为准。

相关阅读