아티클 목록으로
AI 에이전트

GUI-HARVEST, 실행 증거로 GUI 에이전트를 개선하다

약 3분 소요

들어가며

GUI 에이전트는 화면을 읽고 클릭하는 비전언어 모델만으로 완성되지 않습니다. 어떤 관찰 정보를 모델에 제공할지, 모델 출력을 실제 동작으로 어떻게 변환할지, 작업 성공을 어떻게 확인할지, 실패 뒤에 복구할지와 언제 종료할지를 결정하는 실행 하니스가 실제 성능을 좌우합니다. GUI-HARVEST는 모델 가중치를 업데이트하는 대신 실행 하니스 자체를 경험에 따라 개선하는 접근법을 제시합니다.

핵심 작동 방식

GUI 환경에서는 모델의 의도와 화면에 나타난 결과가 쉽게 어긋납니다. 모델이 적절한 버튼을 선택했더라도 좌표 오차, 응답 지연, 예상 밖의 애플리케이션 상태 때문에 전혀 다른 화면이 나올 수 있습니다. GUI-HARVEST는 단순한 최종 성공 여부만 보지 않고, 구체적인 화면 전환을 근거로 실패를 진단합니다.

주요 과정은 세 가지입니다.

  • 의도와 실제 시각 효과를 정렬한다. 모델 출력과 실행된 동작을 동작 전후의 스크린샷에 연결합니다. 이를 통해 문제를 특정 인터페이스 전환과 연관 지을 수 있습니다.
  • 반복 실행을 공동 증거로 활용한다. 같은 작업도 타이밍, 초기 상태, 동작 결과의 차이로 서로 다른 결말을 낼 수 있습니다. 여러 실행을 비교해 결과와 실제로 관련된 행동 차이를 찾습니다.
  • 반복 실패를 재사용 가능한 수정으로 바꾼다. 여러 작업에서 확인된 발견을 공통 실패 패턴으로 통합하고, 이를 범위가 제한된 소스 코드 수정으로 매핑합니다. 평가 전에 예상 행동 효과를 기록한 뒤, 작업 성능과 예측된 효과를 함께 점검합니다.

따라서 이 방법은 관찰, 원인 분석, 수정, 검증의 폐쇄 루프를 만듭니다. 임의의 프롬프트 변경이나 자유로운 코드 재작성보다 변경의 근거와 결과를 추적하기 쉽다는 점이 특징입니다.

결과와 의미

OSWorld-Verified 실험은 범용 모델, GUI 특화 모델, 상용 모델을 포함한 6개 백본을 대상으로 진행됐습니다. 제공된 결과에 따르면 GUI-HARVEST는 제시된 모든 모델·스텝 예산 조합에서 가장 높은 점수를 기록했습니다. 15스텝에서 하니스를 최적화한 뒤, 동일한 하니스를 15, 50, 100스텝 조건에서 평가했습니다. Qwen3-VL-32B-Instruct는 초기 하니스보다 12.33%포인트 향상됐고, Gemini 3.1 Pro는 100스텝에서 79.14%를 기록했습니다.

이 연구의 핵심 메시지는 GUI 에이전트의 개선 대상이 모델에만 한정되지 않는다는 것입니다. 관찰 조립, 동작 실행, 검증기, 복구 로직, 종료 조건 모두 시스템의 병목이 될 수 있습니다. 백본 가중치를 고정한 채 런타임을 개선하면 시스템 설계 변경의 효과를 분리해 평가하기 쉬워지고, 한 작업에서 얻은 수정 사항을 다른 작업에 재사용할 가능성도 커집니다.

다만 스크린샷과 행동 기록의 품질, 실패 원인 추론의 정확성, 기존 능력을 훼손하지 않는 코드 수정이 결과를 좌우합니다. 한 인터페이스에서 유효했던 수정이 다른 환경에서는 부작용을 만들 수 있으므로, 작업 간 지식 이전을 안전하게 제어하는 일도 앞으로의 과제입니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
WebFovea: 모델은 맞는데 클릭이 틀리는 이유
AI 에이전트
cctest.ai
AI 에이전트

WebFovea: 모델은 맞는데 클릭이 틀리는 이유

WebFovea는 2026 WebRetriever Challenge에서 2위를 차지하며, 비전 기반 웹 에이전트의 성능이 모델 추론뿐 아니라 브라우저와 연결되는 실행 계층에도 달려 있음을 보여줬습니다. 같은 모델을 유지한 채 하네스를 개선해 히든 세트 점수를 31.0에서 57.0으로 높였습니다.

더 보기
CCTest · Blog
AdvSim2Real, 진화하는 프롬프트 인젝션에 강한 웹 에이전트 훈련
AI 에이전트
cctest.ai
AI 에이전트

AdvSim2Real, 진화하는 프롬프트 인젝션에 강한 웹 에이전트 훈련

웹 에이전트는 제3자가 작성한 페이지를 읽어야 하지만, 같은 페이지에 작업을 가로채는 지시가 삽입될 수 있습니다. AdvSim2Real은 고정된 웹 월드 모델 안에서 과제, 공격자, 에이전트를 함께 진화시킵니다.

더 보기