GUI-HARVEST, 실행 증거로 GUI 에이전트를 개선하다
들어가며
GUI 에이전트는 화면을 읽고 클릭하는 비전언어 모델만으로 완성되지 않습니다. 어떤 관찰 정보를 모델에 제공할지, 모델 출력을 실제 동작으로 어떻게 변환할지, 작업 성공을 어떻게 확인할지, 실패 뒤에 복구할지와 언제 종료할지를 결정하는 실행 하니스가 실제 성능을 좌우합니다. GUI-HARVEST는 모델 가중치를 업데이트하는 대신 실행 하니스 자체를 경험에 따라 개선하는 접근법을 제시합니다.
핵심 작동 방식
GUI 환경에서는 모델의 의도와 화면에 나타난 결과가 쉽게 어긋납니다. 모델이 적절한 버튼을 선택했더라도 좌표 오차, 응답 지연, 예상 밖의 애플리케이션 상태 때문에 전혀 다른 화면이 나올 수 있습니다. GUI-HARVEST는 단순한 최종 성공 여부만 보지 않고, 구체적인 화면 전환을 근거로 실패를 진단합니다.
주요 과정은 세 가지입니다.
- 의도와 실제 시각 효과를 정렬한다. 모델 출력과 실행된 동작을 동작 전후의 스크린샷에 연결합니다. 이를 통해 문제를 특정 인터페이스 전환과 연관 지을 수 있습니다.
- 반복 실행을 공동 증거로 활용한다. 같은 작업도 타이밍, 초기 상태, 동작 결과의 차이로 서로 다른 결말을 낼 수 있습니다. 여러 실행을 비교해 결과와 실제로 관련된 행동 차이를 찾습니다.
- 반복 실패를 재사용 가능한 수정으로 바꾼다. 여러 작업에서 확인된 발견을 공통 실패 패턴으로 통합하고, 이를 범위가 제한된 소스 코드 수정으로 매핑합니다. 평가 전에 예상 행동 효과를 기록한 뒤, 작업 성능과 예측된 효과를 함께 점검합니다.
따라서 이 방법은 관찰, 원인 분석, 수정, 검증의 폐쇄 루프를 만듭니다. 임의의 프롬프트 변경이나 자유로운 코드 재작성보다 변경의 근거와 결과를 추적하기 쉽다는 점이 특징입니다.
결과와 의미
OSWorld-Verified 실험은 범용 모델, GUI 특화 모델, 상용 모델을 포함한 6개 백본을 대상으로 진행됐습니다. 제공된 결과에 따르면 GUI-HARVEST는 제시된 모든 모델·스텝 예산 조합에서 가장 높은 점수를 기록했습니다. 15스텝에서 하니스를 최적화한 뒤, 동일한 하니스를 15, 50, 100스텝 조건에서 평가했습니다. Qwen3-VL-32B-Instruct는 초기 하니스보다 12.33%포인트 향상됐고, Gemini 3.1 Pro는 100스텝에서 79.14%를 기록했습니다.
이 연구의 핵심 메시지는 GUI 에이전트의 개선 대상이 모델에만 한정되지 않는다는 것입니다. 관찰 조립, 동작 실행, 검증기, 복구 로직, 종료 조건 모두 시스템의 병목이 될 수 있습니다. 백본 가중치를 고정한 채 런타임을 개선하면 시스템 설계 변경의 효과를 분리해 평가하기 쉬워지고, 한 작업에서 얻은 수정 사항을 다른 작업에 재사용할 가능성도 커집니다.
다만 스크린샷과 행동 기록의 품질, 실패 원인 추론의 정확성, 기존 능력을 훼손하지 않는 코드 수정이 결과를 좌우합니다. 한 인터페이스에서 유효했던 수정이 다른 환경에서는 부작용을 만들 수 있으므로, 작업 간 지식 이전을 안전하게 제어하는 일도 앞으로의 과제입니다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…