아티클 목록으로
모델 평가

OSWorld-Pro, 컴퓨터 사용 에이전트를 최종 결과 너머에서 평가하다

약 3분 소요

들어가며

컴퓨터 사용 에이전트(Computer-Use Agents, CUAs)는 키보드와 마우스, 그래픽 사용자 인터페이스를 직접 조작해 여러 단계의 작업을 수행한다. 지금까지는 작업이 끝난 뒤 파일이 올바르게 생성됐는지, 화면 상태가 요구사항에 맞는지와 같은 최종 결과를 기능 검증기로 확인하는 평가가 일반적이었다.

하지만 최종 상태만 확인하면 에이전트가 어디에서 실패했는지 알기 어렵다. 키보드 입력을 잘못했는지, 화면의 버튼을 엉뚱한 위치에서 클릭했는지, 현재 목표와 관계없는 행동을 했는지는 각각 다른 개선책을 요구한다. NVIDIA 연구진이 제안한 OSWorld-Pro는 이 문제를 해결하기 위해 에이전트의 실행 과정을 하위 목표 단위로 평가한다.

핵심 내용

  • 작업을 절차적 단계로 분해한다. OSWorld-Pro는 300개가 넘는 작업과 2800개 이상의 하위 목표로 구성된다. 각 작업을 서로 의존하는 단계들의 연속으로 다루기 때문에, 최종 성공 여부뿐 아니라 중간 진행 상황도 확인할 수 있다.
  • 인간 주석을 평가의 기반으로 삼는다. 이 벤치마크는 6만7000건 이상의 인간 주석을 바탕으로 한다. 또한 인간의 판단과 정렬된 LLM 심판을 사용해 각각의 하위 목표가 충족됐는지 평가한다. 단일 기능 검증기가 제공하기 어려운 세밀한 정보를 얻기 위한 방식이다.
  • 실패 원인을 구체적으로 나눈다. 연구는 현재 하위 목표와 무관한 행동, 클릭 기반 입력의 오류와 같은 과정 중심 실패를 확인한다. 키보드 입력 오류와 시각적 위치 지정 실패를 모두 단순히 “작업 실패”로 처리하면 서로 다른 문제를 구분할 수 없다.
  • 최종 상태 평가보다 더 까다롭다. Claude Opus 5는 OSWorld-Pro에서 75.7%, OSWorld에서 83.4%를 기록했다. 두 수치를 완전히 동일한 기준으로 비교할 수는 없지만, 실행 과정을 살펴보면 최상위 모델도 여전히 불안정한 행동을 보일 수 있음을 시사한다.

의미와 영향

과정 중심 평가는 개발자가 개선 방향을 정하는 데 유용한 진단 신호를 제공한다. 키보드 입력 실수가 반복된다면 행동 생성, 상태 확인, 오류 수정 절차를 점검해야 한다. 클릭 오류가 많다면 화면 요소의 시각적 위치 파악, 좌표 매핑, 클릭 이후의 결과 확인이 핵심이 될 수 있다. 현재 목표와 무관한 행동이 반복된다면 계획 수립, 컨텍스트 관리, 종료 판단에 문제가 있을 가능성이 있다.

최종적으로 정답에 도달한 에이전트라고 해서 항상 안정적인 것은 아니다. 불필요한 조작을 많이 하거나 우연히 올바른 결과에 도달한 경우, 화면이 조금만 바뀌거나 작업이 길어지면 쉽게 실패할 수 있다. 하위 목표별 기록은 에이전트가 일관되게 작업하는지, 아니면 간헐적으로만 성공하는지를 구분하는 데 도움을 준다.

LLM 심판의 활용성은 인간 평가와 얼마나 잘 정렬되는지에 달려 있으므로 지속적인 검증이 필요하다. 그럼에도 OSWorld-Pro는 평가의 초점을 최종 결과에서 실행 경로로 확장한다. 컴퓨터 사용 에이전트가 진정으로 신뢰할 만한지 판단하려면, 무엇을 완성했는지만이 아니라 어떤 과정으로 완성했는지도 살펴봐야 한다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
딥페이크 탐지가 무너질 때, 이미지 재구성 가능성으로 진위를 인증한다
모델 평가
cctest.ai
모델 평가

딥페이크 탐지가 무너질 때, 이미지 재구성 가능성으로 진위를 인증한다

새로운 생성 모델과 적대적 섭동은 기존 딥페이크 탐지기의 성능을 크게 떨어뜨립니다. 한 연구팀은 알려진 생성기가 이미지를 충실하게 재구성할 수 있는지 확인하고, 오인증 위험을 보정하는 접근법을 제안했습니다.

더 보기
CCTest · Blog
의료 오픈엔드 답변에서 검색 기반 사실 검증이 무너지는 이유
모델 평가
cctest.ai
모델 평가

의료 오픈엔드 답변에서 검색 기반 사실 검증이 무너지는 이유

장문 의료 답변의 사실성을 분석한 연구는 검색 후 검증하는 시스템이 폐쇄형 벤치마크에서는 높은 점수를 받아도 임상 오픈엔드 답변에서는 크게 실패할 수 있음을 보여준다. 연구진은 문제를 검색된 증거의 품질과 검증 모델의 추론 오류로 나눠 분석했다.

더 보기
CCTest · Blog
HyperBrowseComp, 다국어·멀티모달 웹 브라우징 에이전트를 시험하다
모델 평가
cctest.ai
모델 평가

HyperBrowseComp, 다국어·멀티모달 웹 브라우징 에이전트를 시험하다

HyperBrowseComp는 웹 브라우징 에이전트를 위한 고난도 평가 벤치마크다. 13개 언어와 다양한 증거 형식을 대상으로, 단순 검색이 아니라 흩어진 단서를 발견하고 연결하며 검증하는 능력을 측정한다.

더 보기