返回文章列表
机器人与物理 AI

EyeRobot 2.0:让机器人用主动注视替代腕部相机

阅读约 3 分钟

导语

在精细机器人操作中,腕部相机常被用来弥补固定视角的不足:当机械臂靠近物体、遮挡主体或需要双手协同时,安装在手腕上的镜头能够提供局部细节。但这也意味着额外的硬件、布线与标定成本。EyeRobot 2.0提出了另一条路线:让机器人像人一样主动转动“眼睛”,把计算资源集中到当前最重要的目标上。

核心方法

  • 主动视觉注视:系统使用单个立体相机及两个可转动的眼部视点,将视线对准场景中的三维固定点。与始终使用固定画面的被动立体视觉相比,机器人可以根据任务阶段主动改变观察方向。
  • 仿生的中心高分辨率处理:获得注视画面后,模型为图像中心分配更多视觉令牌,外围区域则采用更紧凑的表示。这种“中央精细、周边概览”的处理方式,旨在把计算集中在与当前动作最相关的区域。
  • 分层控制注视过程:底层策略负责根据目标物体进行视线伺服,使双眼视点逐步对准目标;上层目标选择器则根据任务进展决定下一次应该注视什么位置。前者采用几何密集奖励训练,后者与行为克隆夹爪策略联合训练,并通过强化学习寻找更适合操作流程的注视序列。
  • 重新组织动作空间:研究还把夹爪信息规范化到相对于注视点的 SE(3) 坐标系中。这样,动作不必始终在全局坐标中表示,有望减少策略需要学习的分布范围。

实验与解读

团队采集了覆盖 7 个真实任务和 6 个模拟任务的遥操作数据,并进行了超过 1000 次实体机器人试验及 1800 次模拟试验,比较主动注视方案、被动立体视觉方案,以及结合自体视角和腕部相机的策略。素材显示,研究重点并非单纯增加更强的视觉编码器,而是把“看哪里”“如何对准”和“如何动作”放进同一套闭环设计中。不过,当前提供的信息没有列出各方法的成功率或具体提升幅度,因此不能据此断言 EyeRobot 2.0 在所有任务上都优于基线。

意义与影响

这项工作的重要价值在于重新审视腕部相机的角色。它并不是简单地删除传感器,而是用可控视点、注视相关坐标和任务级目标选择来补偿局部观察能力。若这一思路能够在更多遮挡、接触和双手协同场景中保持稳定,未来机器人可能通过更少的相机获得更灵活的视觉反馈,同时降低硬件部署复杂度。另一方面,主动注视也引入了新的控制耦合:视线偏差会影响感知,注视时序又会影响抓取,因此系统的鲁棒性、实时性和跨任务泛化仍是后续评估重点。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
机器人没按指令行动,VLA如何在部署现场学会自我补偿?
机器人与物理 AI
cctest.ai
机器人与物理 AI

机器人没按指令行动,VLA如何在部署现场学会自我补偿?

机器人真实执行动作时,常会受到摩擦、回差、负载变化和机械磨损影响,导致动作偏离视觉语言动作模型的指令。来自浦项科技大学的研究提出一种无需任务标签或奖励的在线自补偿方法,并用 RoboStress 系统测试 VLA 的抗执行误差能力。

阅读全文
CCTest · Blog
Skill2Real:让机器人技能从仿真直接走向现实
机器人与物理 AI
cctest.ai
机器人与物理 AI

Skill2Real:让机器人技能从仿真直接走向现实

Skill2Real提出一种面向机器人操作的智能体式技能学习框架,通过统一API、分层记忆和提议者—验证器—治理器闭环,减少仿真到现实迁移中的再训练需求。实验显示,冻结的仿真技能在多项真实操作任务上仍能保持较高完成率。

阅读全文
CCTest · Blog
MotorMind:让通用视觉语言模型直接尝试操作机器人
机器人与物理 AI
cctest.ai
机器人与物理 AI

MotorMind:让通用视觉语言模型直接尝试操作机器人

MotorMind提出一种连接通用视觉语言模型与机器人控制器的执行框架,让模型根据视觉观察提出中层动作,并通过异步反馈持续调整。研究显示,在无需任务专用策略训练的情况下,通用VLM也能完成一定程度的零样本机器人操作。

阅读全文