返回文章列表
机器人与物理 AI

Gemini Robotics ER 2:让机器人看视频、会调度,也能协作

阅读约 2 分钟

导语

Google DeepMind 发布了 Gemini Robotics ER 2,这是一个面向机器人应用的“具身推理”模型。与直接控制关节或电机的底层模型不同,它更像机器人的高层大脑:理解人类指令、观看连续视频、规划多步骤任务,并把具体动作交给 VLA 模型、导航接口或机械臂 API 等低层系统执行。

这次升级的重点不只是“看见世界”,而是让机器人在任务进行中持续判断:现在做到哪一步了,是否失败,什么时候该切换到下一步,以及是否需要其他机器人配合。

核心要点

  • 面向物理任务的工具编排:开发者可以把低层控制接口声明为工具,例如视觉-语言-动作模型、导航 API 或用户自定义函数。Gemini Robotics ER 2 负责把复杂任务拆成步骤,并在执行中选择合适工具。
  • 更实时的执行方式:模型集成到 Gemini Live API,通过双向流式端点处理低延迟场景,使机器人在行动时继续“思考”,减少停下来等待推理的断裂感。
  • 视频理解用于进度追踪:ER 2 可以根据连续视频判断任务完成度。DeepMind 在评测中将视频帧分为五个进度区间,ER 2 在进度分类任务上达到 57.4% 准确率。
  • 关键时刻定位:模型需要判断某个关键事件发生的精确时刻,例如何时停止倒咖啡。ER 2 在 moment-finding 任务上达到 91.3% 准确率,平均绝对距离为 0.96 秒。
  • 多机器人协作:不同形态机器人可以基于共享语义理解进行任务交接。DeepMind 展示了 Apptronik Apollo 2 与 Franka F3 Duo 协作的案例。
  • 空间与安全能力增强:新版本在成功/失败检测、仪表读取、空间问答以及安全指令遵循、人类接近感知等基准上都有改进。

意义与影响

机器人落地的难点往往不在单个动作,而在连续任务中的不确定性:物体滑落、倒水过量、门没有关上,都会让预设流程失效。ER 2 的价值在于把视频理解、时间判断和工具调用放到同一层,让机器人具备更强的任务监督能力。

同时,多机器人协作意味着未来系统不必依赖一种“万能机器人”。轮式机器人、机械臂、人形机器人可以各自发挥优势,由高层模型进行分工与衔接。不过,当前公布的信息仍主要来自 DeepMind 自身评测和演示,真实环境中的稳定性、成本、延迟与安全边界,还需要更多开发者和场景验证。

来源:Google DeepMind

评论

正在确认登录状态……

正在加载评论……

相关文章