核心观点
- 谷歌发布Gemini Robotics ER 2,作为机器人“高级大脑”,通过连续视频理解实现任务进度跟踪与自适应,支持多机器人协作。
- 相比ER 1.6,在工具编排、进度分类、时刻查找等能力上显著提升,在进度分类任务上达到57.4%准确率,时刻查找任务上达到91.3%准确率,且延迟低至亚秒级。
- 支持与VLA模型、导航API等工具集成,通过Gemini Live API实现流式交互,消除“停顿思考”延迟,实现流畅任务编排。
- 在安全指令遵循和人类接近检测基准上表现最佳,能自动暂停并在安全后恢复,为物理AI安全提供新基准。
内容精讲
机器人要在日常环境中辅助人类,仅靠空间推理不够,还需快速时序推理。谷歌发布Gemini Robotics ER 2,作为机器人“高级大脑”,负责理解物理世界、规划多步任务,并将电机执行交给低级视觉-语言-动作(VLA)模型。它还能原生调用Google Search等工具或用户自定义函数,实现“边执行边思考”。该模型现已通过Gemini API、Google AI Studio公开发布,并在Gemini Enterprise Agent Platform上提供私有预览。
**工具编排能力升级**:开发者可将VLA模型或导航API声明为工具,流式输入多模态视频、音频或文本。Gemini Robotics ER 2在三种控制模式下(真实VLA、模拟VLA、人类遥操作)均优于ER 1.6。通过Gemini Live API双向流式端点,实现低延迟任务编排,避免“停顿思考”停顿。例如,与Boston Dynamics的Spot机器人集成,通过自然语言指令取物,相关代码已在GitHub开源。
**时序智能突破**:机器人最难的是知道任务何时完成。Gemini Robotics ER 2通过连续视频理解实现进度分类和时刻查找。进度分类将视频帧分为5级进度(0-20%、20-40%、40-60%、60-80%、80-100%),准确率57.4%,超越前代和竞品。时刻查找识别关键事件帧(如停止倒咖啡),准确率91.3%,平均绝对距离0.96秒,计算成本大幅降低,执行速度提升4倍,达到亚秒级延迟,满足物理机器人安全操作要求。
**多机器人协作**:不同形态机器人(如轮式、人形)通过共享语义理解协同完成任务。Gemini Robotics ER 2使Apptronik的Apollo 2和Franka F3 Duo协作完成复杂工作流,单个机器人无法独立完成。
**空间智能提升**:在成功/失败检测(基于原始视频流而非静态快照)、通用仪器读数(扩展到数字显示屏、线性刻度、尺子、液体温度计等10种类型)、空间VQA等基准上取得最高准确率。
**安全进步**:Gemini Robotics ER 2在安全指令遵循和人类接近检测基准上显著领先。当人靠近时,能成功暂停人形机器人,并在区域清空后自动恢复工作。谷歌还引入新基准评估基础模型作为安全VLA编排器的能力,包括强制安全约束、环境监控、物理可行性评估和寻求人类澄清。
展望未来,谷歌计划推动模型处理更复杂任务,加速开发有用机器人并支持机器人社区。
阅读价值
适合机器人开发者、AI研究人员及对物理AI感兴趣的技术人员,了解谷歌最新机器人推理模型的能力、架构与安全设计,获得将多模态大模型应用于机器人控制的实践参考。
内容与图片版权归原作者所有 · 原文: https://deepmind.google/blog/gemini-robotics-er-2-powering-robotics-with-video-understanding-task-orchestration-and-multi-robot-collaboration/