아티클 목록으로
로보틱스·피지컬 AI

로봇을 프로그래머처럼 움직이게 하는 Physical Coding

약 3분 소요

들어가며

로봇이 물체를 집어 지정된 위치에 놓는 일은 이제 많은 연구에서 구현되고 있습니다. 하지만 물체의 위치가 바뀌거나 카메라 시점이 달라지고, 동작 중간에 실패가 발생했을 때 현재 상태를 파악하고 계획을 수정하는 일은 여전히 어렵습니다. 시각-언어-행동 모델(VLA)과 월드-액션 모델(WAM)은 대체로 관측과 지시를 로봇 행동으로 직접 변환합니다. 이 방식은 단순하고 효율적이지만, 작업 조건과 진행 상황, 실패 복구 방법이 행동 시퀀스 안에 숨겨질 수 있습니다. 그 결과 학습 환경에서 조금만 벗어나도 성능이 흔들릴 수 있습니다.

Hugging Face Daily Papers에 소개된 연구는 이 문제에 대해 ‘Physical Coding’을 제안합니다. 디지털 코딩 에이전트가 도구를 호출하고 결과를 확인한 뒤 실행 가능한 코드를 수정하는 것처럼, 물리 세계의 에이전트도 상태와 실행 절차를 명시적으로 관리하자는 아이디어입니다.

핵심 구조

  • Code as World. 물체, 관계, 제약 조건, 작업 진행 상황을 명시적인 표현으로 기록합니다. 로봇은 해석하기 어려운 행동열만 보는 것이 아니라 현재 세계의 상태를 참조할 수 있습니다.
  • Code as Policy. 계획, 행동 실행, 결과 검증, 실패 복구를 확인하고 수정할 수 있는 절차로 구성합니다. VLA와 WAM은 계속 활용되지만, 전체 의사결정을 맡는 단일 정책이 아니라 더 큰 제어 루프의 도구가 됩니다.
  • Harness의 연결 역할. HexaAnything는 Harness를 이용해 지각, 계획, 제어, 외부 평가 도구를 연결합니다. 실행 결과를 확인한 뒤 루프 안에서 다음 결정을 바꿀 수 있습니다.
  • 검증된 궤적의 재활용. 성공 여부가 확인된 실행 궤적은 학습 데이터, 메모리, 재사용 가능한 프로그램으로 전환될 수 있습니다. 따라서 도구와 데이터에서 시작해 모델까지 이어지는 개선 루프를 만들 수 있습니다.

결과와 한계

RoboCasa365에서 HexaAnything의 Composite-Unseen 성공률은 네이티브 XR-1 VLA의 34.3%에서 38.3%로, 전체 성공률은 56.6%에서 60.8%로 높아졌습니다. Harness로 수집한 데이터로 학습한 27B HexaModel은 보고된 모든 데이터 분할에서 기반 모델보다 좋은 결과를 냈습니다. 평가에는 도구 수정, 시뮬레이션 과학 실험, 실제 로봇 실행도 포함됐습니다. PhyBench와 양팔 AgileX 로봇에서는 물리 실험과 대부분의 테이블 작업을 자율적으로 수행했으며, 공개된 비교 결과보다 빠른 경우도 있었습니다.

다만 이 결과를 완전한 자율 설계형 로봇의 증거로 확대 해석하기는 어렵습니다. 현재 시스템은 Harness, 외부 평가기, 사용 가능한 도구에 의존합니다. 지각 오류, 도구 호출의 불안정성, 장시간 실행에 필요한 비용도 남은 과제입니다. 모델과 도구뿐 아니라 표현, 작업, 하드웨어까지 폭넓게 함께 진화시키는 문제 역시 후속 연구로 남아 있습니다.

의미와 영향

Physical Coding의 중요한 변화는 로봇 경험을 불투명한 모터 명령의 연속이 아니라, 검사하고 수정하고 재사용할 수 있는 표현으로 보려는 데 있습니다. 이 방향이 발전하면 로봇은 고정된 정책을 실행하는 장치를 넘어 상태를 관리하고, 기술을 호출하고, 결과를 검증하며 실행 가능한 경험을 축적하는 에이전트에 가까워질 수 있습니다. 제조, 가정용 로봇, 과학 실험처럼 작업이 길고 환경이 완전히 고정되지 않는 분야에서 특히 의미가 큰 접근입니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
RoboFoundry, 로봇의 실행 경험을 진화하는 시스템으로 전환
로보틱스·피지컬 AI
cctest.ai
로보틱스·피지컬 AI

RoboFoundry, 로봇의 실행 경험을 진화하는 시스템으로 전환

RoboFoundry는 컨텍스트, 메모리, 스킬, 실행 인터페이스를 하나의 ‘시스템-정책’으로 다루는 임바디드 에이전트 프레임워크를 제안한다. 여러 벤치마크에서 장기 기억과 작업 수행 능력의 개선을 보고했다.

더 보기
CCTest · Blog
EmbodiedMemory-Bench, 장기 과제로 구현형 AI의 기억을 평가하다
로보틱스·피지컬 AI
cctest.ai
로보틱스·피지컬 AI

EmbodiedMemory-Bench, 장기 과제로 구현형 AI의 기억을 평가하다

EmbodiedMemory-Bench는 장기간 환경과 상호작용하는 구현형 에이전트의 기억 능력을 실행 가능한 과제로 평가하는 벤치마크입니다. 세밀한 시각 기억부터 과거 경험의 일반화까지 측정하고, 구조화된 외부 메모리 시스템 EMem과 EMem-8B도 제시합니다.

더 보기
CCTest · Blog
사람 손의 능숙함을 로봇으로: Morphometric Imitation이 동작 전이부터 제로샷 제어까지 연결
로보틱스·피지컬 AI
cctest.ai
로보틱스·피지컬 AI

사람 손의 능숙함을 로봇으로: Morphometric Imitation이 동작 전이부터 제로샷 제어까지 연결

UC 버클리 연구진과 공동 연구자들은 인간의 손-물체 상호작용을 실행 가능한 로봇 시연과 시각운동 정책으로 바꾸는 3단계 프레임워크 Morphometric Imitation을 제안했다. 3종 로봇 손과 10개 상호작용 과제에서 평가했으며, 실제 환경 제로샷 실험에서 89.3%의 성공률을 기록했다.

더 보기