RoboFoundry, 로봇의 실행 경험을 진화하는 시스템으로 전환
들어가며
로봇이 한 번 작업을 완료했다고 해서 같은 유형의 작업을 다음에도 안정적으로 수행한다는 뜻은 아니다. 기존 임바디드 에이전트 연구는 메모리, 컨텍스트 관리, 스킬 라이브러리, 액션 인터페이스 등을 각각 최적화하는 경우가 많았다. 파운데이션 모델이 판단을 내리고, 주변 모듈이 정보를 제공하거나 실제 동작을 실행하는 구조다.
문제는 실패 경험이 검증 가능한 시스템 변화로 이어지지 않으면 다음 시도에서도 같은 문제가 반복될 수 있다는 점이다. RoboFoundry는 이를 해결하기 위해 Self-Evolving System-as-Policy라는 관점을 제시한다. 정책을 모델 파라미터나 단일 프롬프트에만 한정하지 않고, 컨텍스트 관리, 메모리 저장, 스킬 구성, 실패 복구 방식까지 포함하는 시스템 전체로 확장한다.
핵심 내용
- 실행 기록으로 능력 부족을 진단한다. 작업 수행 과정을 분석해 의사결정과 메모리 관리의 문제를 찾는다. 경험은 단순한 로그로 남는 대신 특정 작업에 맞는 시스템 업데이트로 변환된다.
- 두 개의 시스템 표면을 함께 진화시킨다. 컨텍스트 시스템은 현재 사용하는 정보와 파일 시스템 기반의 영속 메모리를 관리한다. 계층형 스킬 시스템은 원자적 스킬, 재사용 가능한 조합, 실패 조건별 복구 절차를 조직한다.
- 검증 후 일반화한다. 새로 만들어진 능력은 먼저 관련 작업에서 검증된다. 반복적으로 효과가 확인된 개선만 범용 시스템으로 승격해 단 한 번의 잘못된 경험이 장기 행동으로 남는 위험을 줄인다.
- 판단과 실행을 분리한다. 공유 시맨틱 인터페이스를 통해 로봇에 공통적인 판단과 기체별 실행을 분리한다. 서로 다른 로봇에서도 진화한 시스템 능력을 활용하는 것이 목표다.
보고된 성능
EmbodiedBench에서 RoboFoundry는 논문이 최첨단 성능으로 제시한 결과를 기록했으며, GPT-5.5 대비 27.8% 향상을 보고했다. Qwen3.7-Plus는 70.3%를 기록해 GPT-5.5의 72.7%에 근접했다. 이는 특정 파운데이션 모델 하나에만 의존하지 않는 개선 가능성을 보여준다.
장기 기억을 평가하는 RoboMemArena에서는 외부 파운데이션 모델의 도움을 받는 방법을 포함한 모든 기준선보다 최소 39.0% 높은 성능을 보고했다. LIBERO-PRO에서는 제시된 모든 섭동 유형에서 Cap-Agent0 대비 243.8%에서 679.7%의 향상을 기록했다. 실제 로봇 배치에서는 제로샷 전이와 온라인 진화 사례도 제시됐다.
의미와 남은 과제
RoboFoundry의 중요한 점은 자기개선을 모델 재학습만의 문제로 보지 않는다는 데 있다. 실패 경험이 메모리 구조, 스킬 계층, 향후 복구 절차 자체를 바꿀 수 있다면 긴 작업 과정에서 얻은 지식을 지속적으로 축적할 수 있다. 특히 여러 단계가 이어지고 환경 변화가 발생하는 로봇 작업에 의미가 큰 접근이다.
다만 제공된 자료만으로는 업데이트 알고리즘의 구체적인 방식, 검증 비용, 잘못된 업데이트의 비율, 하드웨어별 상세 비교를 확인하기 어렵다. 더 개방적이고 안전성이 중요한 현실 환경에서도 안정적으로 진화할 수 있는지는 추가 검증이 필요하다. 그럼에도 이 연구는 임바디드 지능의 발전이 더 큰 모델뿐 아니라, 경험을 선별하고 검증하며 재사용하는 시스템 설계에서도 나올 수 있음을 보여준다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…