谷歌发布Gemini Robotics 2,将AI引入物理世界控制机器人
谷歌DeepMind发布Gemini Robotics 2,将视觉语言模型与动作模型结合,使机器人能自主执行复杂任务,标志着AI从数字走向物理世界的重要一步,但安全风险也随之凸显。
谷歌DeepMind刚刚发布了其人工智能模型Gemini的新版本,它可以控制一系列不同的机器人——包括能够执行拧灯泡、系垃圾袋等灵巧任务的类人机器人。Gemini Robotics 2将多个不同AI模型整合到一个系统中。
整体而言,它们使机器人能够理解周围环境并决定如何行动。一个视觉语言模型(VLM)能够理解图像和视频,可与人类交流并推理如何执行不同任务。两个视觉语言动作(VLA)模型经过训练,能够理解如何在物理空间中移动,控制机器人的全身运动以及夹爪或手的动作。
在发布前分享的视频演示中,该公司展示了多个不同机器人使用该整合模型自主执行复杂任务。在一个演示中,Apptronik的Apollo 2机器人使用来自Sharpa公司的双手整理货架。
谷歌DeepMind通过结合人类远程操作、视频示例和模拟来训练模型执行这些任务——目前AI模型还无法在没有特定训练的情况下执行广泛的复杂任务。
尽管Anthropic和OpenAI在聊天机器人和AI编码工具方面处于领先地位,但谷歌在机器人研究方面拥有更强的记录,并发表了关于使用AI训练机器人做有用事情的重要工作。
此次发布是这家搜索巨头押注人工智能需要摆脱数字领域才能充分发挥潜力的另一个迹象。(It此前与腿机器人领域的领导者波士顿动力公司合作,为这些机器提供大脑。
)Google DeepMind机器人部门主管Carolina Parada告诉《连线》:“这是我们真正实现所谓的物理AGI道路上的另一个里程碑,这意味着我们让机器人做人类能做的任何事情。
”然而,让前沿人工智能模型能够接触机器人,以便它们可以在工作场所或家中徘徊并操纵物体,确实存在风险。之前的研究表明,使用前沿人工智能来控制机器人可能会产生意想不到、有时甚至是危险的行为。
这些模型可以在数字领域采取突然或不想要的行动的想法最近变得明显,当时OpenAI开发的一个未发布的人工智能代理黑客攻击了多个系统。帕拉达说:“安全问题更加紧迫,因为你将它们置于很多其他情况下。
”“会出现很多不确定性,所以你希望能够更深入地理解安全问题。”帕拉达表示,谷歌采取多层安全方法,每个模型层都应用了护栏。它还推出了ASIMV-Atlantic,这是一个新基准,用于衡量协作控制机器人的各种人工智能系统的安全性。
该基准检测命令是否会导致有害或不确定的结果。该公司首席执行官Demis Hassabis此前告诉WIRED,他希望为许多不同的机器人开发一种类似于智能手机Android操作系统的人工智能操作系统。