아티클 목록으로
로보틱스·피지컬 AI

EyeRobot 2.0: 손목 카메라 없이 능동 시선으로 정밀 조작

약 3분 소요

배경

정밀한 로봇 조작에서는 고정 카메라만으로 충분하지 않은 순간이 자주 발생한다. 로봇 팔이 물체에 가까워지거나, 한 손이 다른 손이나 대상물을 가리거나, 좁은 공간에서 양손을 함께 사용하면 필요한 국소 정보가 사라질 수 있다. 이를 보완하기 위해 손목 카메라를 장착할 수 있지만, 센서와 배선, 보정 과정, 추가 입력 스트림이 늘어난다. EyeRobot 2.0은 손목 카메라를 더하는 대신 로봇이 스스로 시점을 움직여 필요한 부분을 바라보는 방법을 제안한다.

핵심 구성

  • 능동적 시각 고정: 하나의 스테레오 카메라와 회전 가능한 두 시점을 사용해 장면 속 3D 고정점에 시선을 맞춘다. 카메라는 단순히 영상을 수집하는 장치가 아니라 제어 과정에 참여한다.
  • 중심부에 집중하는 처리: 응시 영상의 중심에 더 많은 시각 토큰을 배정하고 주변부는 상대적으로 압축한다. 현재 조작과 관련된 물체나 접촉 영역에 계산 자원을 집중하려는 방식이다.
  • 계층적 시선 제어: 낮은 수준의 시선 서보 정책은 목표 물체에 시점을 정렬한다. 높은 수준의 타깃 선택기는 작업 진행 상황에 따라 다음 응시 목표를 결정한다. 전자는 조밀한 기하학적 보상으로, 후자는 그리퍼 행동복제 정책과 함께 강화학습으로 학습된다.
  • 응시점 기준 행동 표현: 그리퍼 정보를 응시점에 상대적인 SE(3) 좌표계로 변환한다. 전역 장면 좌표에만 의존하는 대신 현재 관찰 지점을 기준으로 행동을 표현해 학습해야 할 분포를 줄이려는 설계다.

실험과 해석

연구진은 7개의 실제 작업과 6개의 시뮬레이션 작업에 대한 원격조작 데이터를 수집했다. 평가에서는 실물 로봇 1000회 이상, 시뮬레이션 1800회의 시험을 수행하고, 능동 시선 방식과 수동 스테레오 방식, 그리고 자기 시점과 손목 카메라를 함께 사용하는 정책을 비교했다.

이 연구의 차별점은 카메라를 단순히 제거한 데 있지 않다. 어디를 볼지 선택하고, 두 시점을 정렬하고, 이미지 중심에 계산을 집중하며, 그리퍼 동작을 응시점 기준으로 표현하는 과정을 하나의 폐루프에 묶었다는 점이 핵심이다. 다만 제공된 소재에는 각 기준 방법의 성공률이나 정확한 성능 차이가 포함되어 있지 않다. 따라서 모든 작업에서 EyeRobot 2.0이 기준 방법보다 우수하다고 단정해서는 안 된다.

의미와 과제

EyeRobot 2.0은 손목 카메라 문제를 센서 제거가 아니라 ‘물리적 주의집중’의 문제로 다시 정의한다. 로봇이 작업 단계에 맞춰 중요한 대상을 선택하고, 그곳으로 시선을 이동하며, 해당 응시점을 중심으로 행동한다면 더 적은 카메라로도 유용한 국소 피드백을 확보할 가능성이 있다.

반면 새로운 결합 문제도 생긴다. 응시가 어긋나면 인식 품질이 떨어지고, 응시 순서가 비효율적이면 조작 자체를 방해할 수 있다. 실시간성, 가림과 접촉 상황에서의 견고성, 학습에 없던 작업으로의 일반화가 후속 검증의 핵심이 될 것이다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
Skill2Real: 로봇 조작 기술을 시뮬레이션에서 현실로
로보틱스·피지컬 AI
cctest.ai
로보틱스·피지컬 AI

Skill2Real: 로봇 조작 기술을 시뮬레이션에서 현실로

Skill2Real은 작업별 정책을 다시 미세 조정하는 대신, 공통 API를 통해 실행 가능한 로봇 조작 기술을 이전하는 에이전트형 프레임워크를 제안한다. 계층적 메모리와 제안자·검증자·거버너 루프를 활용해 동결된 시뮬레이션 기술의 실제 로봇 적용 가능성을 평가했다.

더 보기
CCTest · Blog
MotorMind, 범용 VLM의 제로샷 로봇 조작을 시험하다
로보틱스·피지컬 AI
cctest.ai
로보틱스·피지컬 AI

MotorMind, 범용 VLM의 제로샷 로봇 조작을 시험하다

MotorMind는 범용 비전·언어 모델이 로봇의 관찰, 행동 선택, 실행 확인을 직접 수행할 수 있는지 검증하는 실행 프레임워크다. 중간 수준 행동 표현과 비동기 피드백을 활용해 전용 정책이나 코딩 에이전트 없이 로봇 조작을 시도한다.

더 보기