EyeRobot 2.0:让机器人用主动注视替代腕部相机
导语
在精细机器人操作中,腕部相机常被用来弥补固定视角的不足:当机械臂靠近物体、遮挡主体或需要双手协同时,安装在手腕上的镜头能够提供局部细节。但这也意味着额外的硬件、布线与标定成本。EyeRobot 2.0提出了另一条路线:让机器人像人一样主动转动“眼睛”,把计算资源集中到当前最重要的目标上。
核心方法
- 主动视觉注视:系统使用单个立体相机及两个可转动的眼部视点,将视线对准场景中的三维固定点。与始终使用固定画面的被动立体视觉相比,机器人可以根据任务阶段主动改变观察方向。
- 仿生的中心高分辨率处理:获得注视画面后,模型为图像中心分配更多视觉令牌,外围区域则采用更紧凑的表示。这种“中央精细、周边概览”的处理方式,旨在把计算集中在与当前动作最相关的区域。
- 分层控制注视过程:底层策略负责根据目标物体进行视线伺服,使双眼视点逐步对准目标;上层目标选择器则根据任务进展决定下一次应该注视什么位置。前者采用几何密集奖励训练,后者与行为克隆夹爪策略联合训练,并通过强化学习寻找更适合操作流程的注视序列。
- 重新组织动作空间:研究还把夹爪信息规范化到相对于注视点的 SE(3) 坐标系中。这样,动作不必始终在全局坐标中表示,有望减少策略需要学习的分布范围。
实验与解读
团队采集了覆盖 7 个真实任务和 6 个模拟任务的遥操作数据,并进行了超过 1000 次实体机器人试验及 1800 次模拟试验,比较主动注视方案、被动立体视觉方案,以及结合自体视角和腕部相机的策略。素材显示,研究重点并非单纯增加更强的视觉编码器,而是把“看哪里”“如何对准”和“如何动作”放进同一套闭环设计中。不过,当前提供的信息没有列出各方法的成功率或具体提升幅度,因此不能据此断言 EyeRobot 2.0 在所有任务上都优于基线。
意义与影响
这项工作的重要价值在于重新审视腕部相机的角色。它并不是简单地删除传感器,而是用可控视点、注视相关坐标和任务级目标选择来补偿局部观察能力。若这一思路能够在更多遮挡、接触和双手协同场景中保持稳定,未来机器人可能通过更少的相机获得更灵活的视觉反馈,同时降低硬件部署复杂度。另一方面,主动注视也引入了新的控制耦合:视线偏差会影响感知,注视时序又会影响抓取,因此系统的鲁棒性、实时性和跨任务泛化仍是后续评估重点。
评论
正在确认登录状态……
正在加载评论……