AI 见闻
精选· 重要性 5/5

Gemini Robotics ER 2:视频理解、任务编排与多机器人协作驱动机器人新能力

Google DeepMind Blog··约 8 分钟阅读
中文导读

Google DeepMind 发布 Gemini Robotics ER 2,这是其最强大的具身推理模型,通过实时视频理解、任务进度追踪和多机器人协作,显著提升机器人在物理世界中的自主性与安全性。

推出 Gemini Robotics ER 2对于机器人要在日常环境中协助人类而言,准确的空间推理还不够。机器人还必须快速思考,根据物理世界的实时速度来安排决策时机并进行推理。

因此,今天我们发布了 Gemini Robotics ER 2,这是我们最强大的机器人“具身推理”模型。可以将 Gemini Robotics ER 2 视为机器人的高级大脑。它让机器人能够与人类对话、理解物理世界并规划多步骤任务。

然后,它将运动执行交给任何给定的底层视觉-语言-动作(VLA)模型。Gemini Robotics ER 2 还可以原生调用 Google Search 等工具来查找信息,或调用任何其他用户定义的函数。

Gemini Robotics ER 2 的设计允许机器人在执行动作的同时“思考”下一步该做什么。Gemini Robotics ER 2 相比 Gemini Robotics ER 1.6 有显著升级。

通过观看连续的视频流,机器人现在可以跟踪自己的进度,在出现问题时进行调整,并准确知道何时进入下一步。我们还引入了多机器人协作,使机器人能够在共享空间中共同工作,完成单个机器人无法独立完成的复杂工作流程。

Gemini Robotics ER 2 现已通过 Gemini API、Google AI Studio 向开发者公开,并在 Gemini Enterprise Agent Platform 上提供私人预览。

为了帮助您快速上手,我们分享了如何配置模型并编写提示词以驱动更有用的物理 AI 任务的示例。提升物理智能体能力物理世界中的大多数任务都很复杂,需要多个步骤才能完成。

Gemini Robotics ER 2 是一个物理智能体,它为机器人编排步骤,使其能够自我纠正,并泛化到更多新场景。为了构建智能体设置,开发者可以将底层控制接口(如视觉-语言-动作(VLA)模型或导航 API)声明为工具,并将多模态视频、音频或文本直接流式传输到模型中。

Gemini Robotics ER 2 改进了这种工具编排工作流。我们可以在模拟环境中用机器人评估其性能,使用真实世界的机器人控制,甚至将其与远程控制机器人的人类配对。

在三种控制模式(真实 VLA、模拟 VLA 和人类遥操作)下,Gemini Robotics ER 2 在工具编排方面始终优于 ER 1.6。在机器人技术中,高层推理依赖于执行速度。

Gemini Robotics ER 2 集成到 Gemini Live API 中,使用针对延迟敏感任务优化的双向流式端点。

结果是流畅的编排:Gemini Robotics ER 2 命令动作模型和机器人 API 完成多步骤任务,而不会出现令人不适的“停下来思考”的停顿。为了说明这一点,我们与合作伙伴 Boston Dynamics 一起用 Spot 构建了一个演示。

我们使用 Gemini Robotics ER 2 来编排 Spot 的 API,例如导航和机械臂运动,创建了一个能为你取物的交互式机器人。由 Gemini Robotics ER 2 驱动的 Boston Dynamics Spot 在收到自然语言指令后取来爆米花零食。

代码已在 GitHub 上与其他示例一起提供。解锁时间智能以实现稳健的任务完成机器人技术中最困难的挑战之一是知道任务何时完成。

Gemini Robotics ER 2 在视频理解和进度跟踪方面带来了阶跃性变化,能够验证复杂任务(如拧紧灯泡或系好垃圾袋)是否按规范完成,然后再切换到下一个任务。在此次更新中,我们在任务进度理解的两项基础能力上取得了进展:进度分类和时刻定位。

连续进度分类进度分类是指机器人跟踪任务完成进度的能力。在我们的评估中,我们将视频流中的每一帧分配到五个进度级别(0-20%、20-40%、40-60%、60-80%、80-100%)。

通过量化任务进度,Gemini Robotics ER 2 为机器人提供实时态势感知,使其能够即时调整动作或重试失败的步骤,而无需重新启动整个工作流。Gemini Robotics ER 2 在进度分类任务上达到了 57.4% 的准确率,优于上一代模型和竞争的前沿模型。

精确时刻定位时刻定位衡量模型识别关键事件发生的精确视频帧的能力(例如,何时停止往杯子里倒咖啡)。Gemini Robotics ER 2 在时刻定位上取得了显著的性能提升,使机器人能够在任务之间精确切换、验证成功并提出纠正建议。

在时刻定位任务上,Gemini Robotics ER 2 达到了 91.3% 的准确率和 0.96 秒的平均绝对距离。它与更大的模型类别竞争激烈,但以极低的算力成本和 4 倍的执行速度提供了这种精度——这是在现实世界中安全操作物理机器人实际所需的亚秒级延迟。

多机器人协作没有单个机器人能适应所有任务——轮式漫游车在室内表现出色,而人形机器人可能在不平坦的地形上更胜一筹。Gemini Robotics 2 实现了多机器人协作,允许不同机器通过共享的语义理解进行通信,以交接并完成复杂任务。

了解 Gemini Robotics ER 2 如何让 Apptronik 的 Apollo 2 和 Franka F3 Duo 在此协作。

提升通用空间智能Gemini Robotics ER 2 提升了我们的核心空间推理能力,通过三个基准测试来衡量:- 成功/失败检测:现在基于原始视频流而非静态快照,以捕捉执行过程中的故障,如溢出、打滑或未对齐。

- 通用仪表读数:超越圆形表盘和视镜,扩展到数字显示屏、线性刻度尺、直尺和液体温度计。我们在 10 种不同类型的仪表上进行了测试。- 增强的空间 VQA:通过 Gemini 在多模态理解方面的进步改进了视觉问答。

Gemini Robotics ER 2 在所有核心能力上始终达到最高准确率,亮点包括成功检测(图像/视频)、问答(ERQA)和通用仪表读数。

推进具身智能的安全性Gemini Robotics ER 2 是我们最安全的模型,在安全指令遵循和人类接近度基准测试上取得了显著进步,这些基准评估模型在推理任务中遵守物理约束的能力以及检测人类的空间意识。

我们发现,当有人靠近时,Gemini Robotics ER 2 能成功停止人形机器人,并仅在区域清空后自动恢复工作。

为了推进物理智能体的安全性,我们引入了一个基准测试,通过测试基础模型执行安全约束、监控环境、评估物理可行性以及寻求人类澄清的能力,来评估其作为安全 VLA 编排器的能力。详情请参阅我们的安全技术报告。

Gemini Robotics ER 2 在安全指令遵循和人类接近度基准测试上优于 ER 1.6 和其他前沿模型。

展望未来,我们的计划是将这些模型推向更复杂的任务,以加速开发有用的机器人并支持机器人社区。

原文出处
Gemini Robotics ER 2: powering robotics with video understanding, task orchestration, and multi-robot collaboration

本文为机器翻译辅以 AI 润色,仅供参考。原始事实以原文为准。

相关阅读