아티클 목록으로
로보틱스·피지컬 AI

RoboFollow가 드러낸 임바디드 에이전트의 ‘지시 따르기’ 착시

약 3분 소요

들어가며

로봇 연구에서 작업 성공률은 가장 자주 인용되는 성능 지표입니다. 하지만 로봇이 행동을 완료했다는 사실만으로 주어진 지시를 이해했다고 볼 수는 없습니다. 장면에 물체 하나와 목표 하나만 있고 가능한 행동도 한 가지라면, 모델은 언어를 무시한 채 장면을 인식하고 기본 행동을 실행해도 높은 점수를 얻을 수 있습니다.

RoboFollow는 이런 현상을 지시 추종 착시라고 부릅니다. 연구진이 원인으로 지목한 것은 ‘낮은 장면 엔트로피’입니다. 시각 정보만으로 과제가 거의 유일하게 결정되는 환경에서는 언어가 의사결정에 제공하는 추가 정보가 사라집니다.

언어를 반드시 사용해야 하는 장면

RoboFollow는 단순히 지시문을 복잡하게 만드는 대신, 하나의 시각 장면에 여러 작업 분기를 배치합니다. 지시에 따라 다른 물체를 고르고, 특정 공간 관계를 판단하며, 궤적 제약을 따르거나 다른 논리 분기를 선택해야 합니다. 각 분기는 운동학적으로도 구별되므로, 시각만으로는 정답을 결정할 수 없습니다. 정책은 언어와 장면 상태를 연결해야 합니다.

이 벤치마크는 RoboTwin을 기반으로 하며 네 가지 장면 계열, 전문가 시연 데이터, 평가 프로토콜, 코드와 데이터셋을 제공합니다. 핵심은 최종 동작이 성공했는지만 보는 것이 아니라, 지시가 바뀌었을 때 행동도 그에 맞게 달라지는지를 확인하는 데 있습니다.

진단 프로토콜의 구성

  • 높은 장면 엔트로피: 같은 장면 설정에서 여러 유효한 작업을 가능하게 합니다.
  • L0-L3 단계 평가: 시각 배치와 의미를 점진적으로 변화시키며 공간 관계, 속성, 궤적 제약, 논리 조건을 살핍니다.
  • Intent와 Execution 분리: 올바른 작업 의도를 선택했는지와 실제 물리 행동을 완료했는지를 따로 측정합니다.
  • 혼란 요인 통제: 상호작용 물체를 단순화하고 행동을 학습된 범위로 제한해, 불필요한 운동 제어 난도를 낮춥니다.

이 구분은 실용적입니다. 실패는 지시를 잘못 해석해서일 수도 있고, 잘못된 물체를 골라서일 수도 있으며, 올바른 계획을 제대로 실행하지 못해서일 수도 있습니다. 하나의 성공률만으로는 원인을 판별하기 어렵습니다.

평가 결과가 시사하는 점

연구진은 9개의 VLA 및 WAM 정책을 평가했습니다. L0에서 좋은 성능을 보인 정책도 보고된 파인튜닝 설정에서는 L1-L3로 안정적으로 일반화되지 않았습니다. 더 강한 VLM 백본, 질의응답 공동 학습, LangForce, Classifier-Free Guidance와 같은 대표적 완화책도 이 격차를 해소하지 못했습니다.

이 결과가 모든 로봇 정책이 언어를 무시한다는 뜻은 아닙니다. 다만 기존 벤치마크의 높은 점수만으로는 언어가 실제 의사결정에 사용됐는지 확인하기 어렵다는 의미입니다. 시각 인식과 동작 모방에는 강한 시스템도, 여러 가능한 행동 중 언어에 맞는 하나를 선택해야 하는 상황에서는 취약할 수 있습니다.

의미와 영향

RoboFollow는 지시 추종을 단순한 제어 문제가 아니라, 제어에 앞선 작업 선택 문제로 다시 정의합니다. 앞으로의 데이터셋에는 같은 장면에 대한 반사실적 지시와 다중 작업 분기가 포함될 필요가 있습니다. 평가 보고서도 실행 결과뿐 아니라 의도 선택 결과를 함께 제시해야 합니다.

언어가 없어도 정답을 맞힐 수 있는 환경에서는 높은 점수가 언어 이해를 증명하지 못합니다. RoboFollow는 이처럼 감춰진 약점을 드러내기 위한 더 엄격한 임바디드 AI 평가 관점을 제시합니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
HuRo, 인간 영상을 확장 가능한 VLA 사전학습 데이터로 변환
로보틱스·피지컬 AI
cctest.ai
로보틱스·피지컬 AI

HuRo, 인간 영상을 확장 가능한 VLA 사전학습 데이터로 변환

HuRo는 서로 다른 인간 조작 영상을 로봇에 맞는 관측과 행동 궤적으로 변환하는 로봇화 파이프라인을 제안한다. 실험 결과, 이 데이터를 활용한 사전학습 규모를 키우면 실제 조작 성능과 분포 외 일반화가 함께 향상됐다.

더 보기