로봇을 프로그래머처럼 움직이게 하는 Physical Coding
들어가며
로봇이 물체를 집어 지정된 위치에 놓는 일은 이제 많은 연구에서 구현되고 있습니다. 하지만 물체의 위치가 바뀌거나 카메라 시점이 달라지고, 동작 중간에 실패가 발생했을 때 현재 상태를 파악하고 계획을 수정하는 일은 여전히 어렵습니다. 시각-언어-행동 모델(VLA)과 월드-액션 모델(WAM)은 대체로 관측과 지시를 로봇 행동으로 직접 변환합니다. 이 방식은 단순하고 효율적이지만, 작업 조건과 진행 상황, 실패 복구 방법이 행동 시퀀스 안에 숨겨질 수 있습니다. 그 결과 학습 환경에서 조금만 벗어나도 성능이 흔들릴 수 있습니다.
Hugging Face Daily Papers에 소개된 연구는 이 문제에 대해 ‘Physical Coding’을 제안합니다. 디지털 코딩 에이전트가 도구를 호출하고 결과를 확인한 뒤 실행 가능한 코드를 수정하는 것처럼, 물리 세계의 에이전트도 상태와 실행 절차를 명시적으로 관리하자는 아이디어입니다.
핵심 구조
- Code as World. 물체, 관계, 제약 조건, 작업 진행 상황을 명시적인 표현으로 기록합니다. 로봇은 해석하기 어려운 행동열만 보는 것이 아니라 현재 세계의 상태를 참조할 수 있습니다.
- Code as Policy. 계획, 행동 실행, 결과 검증, 실패 복구를 확인하고 수정할 수 있는 절차로 구성합니다. VLA와 WAM은 계속 활용되지만, 전체 의사결정을 맡는 단일 정책이 아니라 더 큰 제어 루프의 도구가 됩니다.
- Harness의 연결 역할. HexaAnything는 Harness를 이용해 지각, 계획, 제어, 외부 평가 도구를 연결합니다. 실행 결과를 확인한 뒤 루프 안에서 다음 결정을 바꿀 수 있습니다.
- 검증된 궤적의 재활용. 성공 여부가 확인된 실행 궤적은 학습 데이터, 메모리, 재사용 가능한 프로그램으로 전환될 수 있습니다. 따라서 도구와 데이터에서 시작해 모델까지 이어지는 개선 루프를 만들 수 있습니다.
결과와 한계
RoboCasa365에서 HexaAnything의 Composite-Unseen 성공률은 네이티브 XR-1 VLA의 34.3%에서 38.3%로, 전체 성공률은 56.6%에서 60.8%로 높아졌습니다. Harness로 수집한 데이터로 학습한 27B HexaModel은 보고된 모든 데이터 분할에서 기반 모델보다 좋은 결과를 냈습니다. 평가에는 도구 수정, 시뮬레이션 과학 실험, 실제 로봇 실행도 포함됐습니다. PhyBench와 양팔 AgileX 로봇에서는 물리 실험과 대부분의 테이블 작업을 자율적으로 수행했으며, 공개된 비교 결과보다 빠른 경우도 있었습니다.
다만 이 결과를 완전한 자율 설계형 로봇의 증거로 확대 해석하기는 어렵습니다. 현재 시스템은 Harness, 외부 평가기, 사용 가능한 도구에 의존합니다. 지각 오류, 도구 호출의 불안정성, 장시간 실행에 필요한 비용도 남은 과제입니다. 모델과 도구뿐 아니라 표현, 작업, 하드웨어까지 폭넓게 함께 진화시키는 문제 역시 후속 연구로 남아 있습니다.
의미와 영향
Physical Coding의 중요한 변화는 로봇 경험을 불투명한 모터 명령의 연속이 아니라, 검사하고 수정하고 재사용할 수 있는 표현으로 보려는 데 있습니다. 이 방향이 발전하면 로봇은 고정된 정책을 실행하는 장치를 넘어 상태를 관리하고, 기술을 호출하고, 결과를 검증하며 실행 가능한 경험을 축적하는 에이전트에 가까워질 수 있습니다. 제조, 가정용 로봇, 과학 실험처럼 작업이 길고 환경이 완전히 고정되지 않는 분야에서 특히 의미가 큰 접근입니다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…