아티클 목록으로
모델 평가

GMA, 현실에 가까운 복잡한 작업으로 모바일 에이전트 평가

약 3분 소요

모바일 인터페이스는 멀티모달 에이전트를 평가하는 중요한 환경으로 자리 잡고 있다. 하지만 실제 스마트폰 작업은 화면에서 버튼 하나를 찾는 것보다 훨씬 복잡하다. 여러 화면이나 앱을 오가고, 앞선 단계에서 얻은 정보를 기억하며, 현재 상태를 점검한 뒤 다음 행동을 선택해야 한다. 짧고 독립적인 조작만으로는 이런 능력의 부족을 충분히 드러내기 어렵다.

GMA(General Mobile Assistants)는 이러한 한계를 보완하기 위해 설계된 새로운 벤치마크다. 연구팀은 AndroidWorld와 MobileWorld가 모바일 에이전트 평가의 중요한 기반을 제공하지만, 기존의 앱 범위와 과제 설계만으로는 실제 모바일 사용의 다양성과 복잡성을 온전히 반영하기 어렵다고 설명한다.

GMA는 오픈소스 프로젝트를 바탕으로 만든 7개 애플리케이션을 도입한다. 대상 영역에는 라이프스타일 공유와 여행 계획 등이 포함된다. 또한 단일 원자적 행동부터 여러 작업을 연결해 수행해야 하는 복잡한 워크플로까지, 총 300개 과제를 4개 난이도 구간으로 구성했다.

핵심 내용

  • 범용 어시스턴트에 가까운 과제: 단순한 탭, 입력, 화면 이동을 넘어, 에이전트가 서로 다른 앱 환경에서 사용자의 목표를 이해하고 전체 절차를 수행할 수 있는지 평가한다.
  • 복잡도가 성능을 가른다: 8개 프런티어 모델을 평가한 결과, 과제가 복잡해질수록 성능이 크게 하락했다. 인터페이스를 조작할 수 있다는 사실만으로 실제 요구사항을 안정적으로 완료한다고 볼 수 없다.
  • 실행 하니스의 영향: 연구팀은 환경, 모델 설정, 과제 분류를 공유한 조건에서 컨텍스트 유지와 명시적 상태 추적 등 여러 에이전트 하니스 선택을 비교했다. 적절한 설계는 특히 어려운 워크플로에서 도움을 줬지만, 효과의 크기와 방향은 기반 모델마다 달랐다.

이 결과는 모바일 에이전트의 신뢰성이 기반 모델 하나의 능력으로만 결정되지 않는다는 점을 보여준다. 이전 정보를 어떻게 보존하는지, 현재 상태를 어떻게 표현하는지, 중간 결과를 확인하는지, 한 단계가 실패했을 때 어떻게 복구하는지가 최종 결과에 영향을 준다. 강력한 모델이라도 실행 하니스가 워크플로의 구조를 유지하지 못하면 긴 작업에서 쉽게 흐름을 놓칠 수 있다.

따라서 모바일 에이전트 평가의 질문도 바뀔 필요가 있다. 올바른 시각적 대상을 찾아 클릭할 수 있는지만 볼 것이 아니라, 모델과 실행 프레임워크가 함께 열린 형태의 사용자 요구를 끝까지 충족할 수 있는지를 확인해야 한다. 긴 워크플로에서는 계획, 기억, 시각 이해, 행동 선택이 서로 분리될 수 없기 때문이다.

개발자에게 GMA는 장시간 상호작용의 어느 지점에서 실패가 발생하는지 찾고, 컨텍스트 및 상태 관리 방식을 비교하는 도구가 될 수 있다. 연구자에게는 더 넓은 앱 범위와 높은 과제 복잡도를 제공하는 실험 환경이다. 이 벤치마크가 말하는 핵심은 단순히 과제 수를 늘리는 데 있지 않다. 모바일 어시스턴트가 일상적인 요청을 맡으려면, 복잡한 워크플로를 안정적으로 끝까지 실행하는 능력을 먼저 확보해야 한다는 점이다.

출처: arXiv

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
UrbanGround, 실제 규모 도시에서 멀티모달 에이전트의 공간 능력을 검증하다
모델 평가
cctest.ai
모델 평가

UrbanGround, 실제 규모 도시에서 멀티모달 에이전트의 공간 능력을 검증하다

UrbanGround는 홍콩 전역의 3D 지리공간 데이터로 상호작용 가능한 도시 샌드박스를 만들어, 멀티모달 모델이 국소적인 시각 이해를 장거리 이동과 지속적인 행동으로 연결할 수 있는지 평가한다. 현재 MLLM은 가까운 거리의 인식에는 강하지만, 긴 탐색에서는 방향 유지와 오류 수정이 불안정하다.

더 보기
CCTest · Blog
평가 결과는 실제로 무엇을 입증할 수 있는가
모델 평가
cctest.ai
모델 평가

평가 결과는 실제로 무엇을 입증할 수 있는가

특정 커밋에 고정한 Inspect Evals 전수 조사에서, 실행 가능한 평가 코드만으로는 지표에 연결된 과거의 주장까지 재현할 수 없다는 점이 드러났다. 기계적으로 대상이 된 124개 유닛 중 110개는 필요한 증거 또는 의미적 근거가 없어 결정적 추론에 들어가기 전에 중단됐다.

더 보기
CCTest · Blog
Video-IFBench, 동영상 멀티모달 모델의 지시 준수 능력 평가
모델 평가
cctest.ai
모델 평가

Video-IFBench, 동영상 멀티모달 모델의 지시 준수 능력 평가

Video-IFBench는 동영상을 정확히 이해하는지를 넘어 시각·음성·의미·형식·조건 분기를 포함한 복잡한 지시를 따르는지 평가한다. 20개가 넘는 최신 MLLM을 대상으로 한 평가에서 동영상 지시 준수의 어려움이 드러났다.

더 보기