덜 보고 더 잘 움직이는 로봇: PyRUA-Lean의 토큰 절감 방식
들어가며
로봇 에이전트가 모든 동작 뒤에 이미지를 다시 보고, 사소한 판단마다 언어 모델을 호출한다고 해서 항상 더 안정적인 것은 아닙니다. 시각언어모델 기반 로봇은 관찰, 계획, 행동, 재관찰의 순환을 반복하는데, 비슷한 이미지와 상태가 계속 입력되면 토큰 비용과 지연 시간이 커집니다. 모델이 직접 처리하지 않아도 되는 간단한 제어 판단까지 매번 LLM에 맡기는 문제도 생깁니다.
Hugging Face Daily Papers에 소개된 PyRUA-Lean은 이 상호작용 방식을 바꿉니다. 에이전트는 개별 도구를 순서대로 호출하는 대신 실행 가능한 Python 셀을 작성합니다. 하나의 셀 안에서 여러 행동을 조합하고 상태를 확인하며, 필요한 경우 국소적으로 재시도할 수 있습니다. 이후 계획을 다시 세우는 데 필요한 정보만 선택적으로 반환하는 것이 핵심입니다.
핵심 구성
- 코드 기반 행동 조합: 고전적인 로봇 프리미티브와 학습된 시각언어행동(VLA) 정책을 하나의 실행 흐름에서 결합합니다.
- 로컬 조건 처리: 간단한 상태 확인과 재시도는 실행 셀에서 처리하므로, 작은 변화마다 새 LLM 호출을 할 필요가 줄어듭니다.
- 선택적 관찰: 에이전트가 명시적으로 요청한 이미지와 상태 피드백만 반환해 중복 입력을 줄입니다.
- 동일 조건 비교: PyRUA-Lean과 도구 호출 기준선은 같은 GPT-6 Astra 플래너와 동일한 하위 로봇 프리미티브를 사용했습니다.
실험 결과
평가는 LIBERO-PRO, RoboTwin 2.0, RoboCasa365에서 가져온 700개 시뮬레이션 과제를 대상으로 진행됐습니다. LLM 호출 예산을 동일하게 맞췄을 때 기준선의 전체 성공률은 63.1%, PyRUA-Lean은 71.7%였습니다. 8.6%포인트의 차이로, 상대적으로는 약 14% 개선에 해당합니다.
효율성 측정도 주목할 만합니다. 두 에이전트가 모두 해결한 과제만 보면 PyRUA-Lean은 LLM 호출을 49%, 입력 토큰을 65% 적게 사용했습니다. 성공률을 높이기 위해 모델에 더 자주 질문한 것이 아니라, 일부 제어 로직을 실행 계층으로 옮겨 모델이 실제 재계획이 필요한 상황에 집중하도록 만든 결과로 볼 수 있습니다.
의미와 한계
이 연구는 로봇 에이전트의 병목이 모델의 규모나 능력에만 있지 않다는 점을 보여줍니다. 모델과 환경 사이의 상호작용 프로토콜도 중요합니다. 여러 행동을 묶고, 조건 판단과 제한적인 재시도를 실행 환경에서 처리하면 컨텍스트 증가와 응답 지연을 줄이면서 필요할 때는 모델의 재계획을 유지할 수 있습니다.
다만 이번 결과는 세 개의 시뮬레이션 벤치마크에 한정됩니다. 제공된 자료만으로는 실제 로봇, 다른 플래너 모델, 장시간 현실 작업에서도 같은 효과가 유지되는지 확인할 수 없습니다. 따라서 토큰 절감을 곧바로 실제 배치 신뢰성으로 해석해서는 안 됩니다. 그럼에도 모든 관찰을 모델에 보내기보다 일상적인 피드백은 실행 계층에서 처리하고, 의미 있는 판단만 모델에 맡긴다는 방향은 로봇 에이전트 설계에서 실용적인 선택지가 될 수 있습니다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…