核心观点

内容精讲

机器人要在日常环境中辅助人类,仅靠空间推理不够,还需快速时序推理。谷歌发布Gemini Robotics ER 2,作为机器人“高级大脑”,负责理解物理世界、规划多步任务,并将电机执行交给低级视觉-语言-动作(VLA)模型。它还能原生调用Google Search等工具或用户自定义函数,实现“边执行边思考”。该模型现已通过Gemini API、Google AI Studio公开发布,并在Gemini Enterprise Agent Platform上提供私有预览。

**工具编排能力升级**:开发者可将VLA模型或导航API声明为工具,流式输入多模态视频、音频或文本。Gemini Robotics ER 2在三种控制模式下(真实VLA、模拟VLA、人类遥操作)均优于ER 1.6。通过Gemini Live API双向流式端点,实现低延迟任务编排,避免“停顿思考”停顿。例如,与Boston Dynamics的Spot机器人集成,通过自然语言指令取物,相关代码已在GitHub开源。

**时序智能突破**:机器人最难的是知道任务何时完成。Gemini Robotics ER 2通过连续视频理解实现进度分类和时刻查找。进度分类将视频帧分为5级进度(0-20%、20-40%、40-60%、60-80%、80-100%),准确率57.4%,超越前代和竞品。时刻查找识别关键事件帧(如停止倒咖啡),准确率91.3%,平均绝对距离0.96秒,计算成本大幅降低,执行速度提升4倍,达到亚秒级延迟,满足物理机器人安全操作要求。

**多机器人协作**:不同形态机器人(如轮式、人形)通过共享语义理解协同完成任务。Gemini Robotics ER 2使Apptronik的Apollo 2和Franka F3 Duo协作完成复杂工作流,单个机器人无法独立完成。

**空间智能提升**:在成功/失败检测(基于原始视频流而非静态快照)、通用仪器读数(扩展到数字显示屏、线性刻度、尺子、液体温度计等10种类型)、空间VQA等基准上取得最高准确率。

**安全进步**:Gemini Robotics ER 2在安全指令遵循和人类接近检测基准上显著领先。当人靠近时,能成功暂停人形机器人,并在区域清空后自动恢复工作。谷歌还引入新基准评估基础模型作为安全VLA编排器的能力,包括强制安全约束、环境监控、物理可行性评估和寻求人类澄清。

展望未来,谷歌计划推动模型处理更复杂任务,加速开发有用机器人并支持机器人社区。

阅读价值

适合机器人开发者、AI研究人员及对物理AI感兴趣的技术人员,了解谷歌最新机器人推理模型的能力、架构与安全设计,获得将多模态大模型应用于机器人控制的实践参考。

阅读原文 → 返回 AI 技术文档

内容与图片版权归原作者所有 · 原文: https://deepmind.google/blog/gemini-robotics-er-2-powering-robotics-with-video-understanding-task-orchestration-and-multi-robot-collaboration/