아티클 목록으로
월드 모델

AutoGUIWorld, 이미지 생성기로 GUI 에이전트의 가상 환경 구축

약 3분 소요

배경

GUI 에이전트가 실제 컴퓨터 작업을 수행하려면 버튼의 위치를 찾는 능력만으로는 부족하다. 어떤 행동이 화면을 어떻게 바꾸는지 파악하고, 여러 단계에 걸쳐 현재 상태를 유지하며 다음 행동을 선택해야 한다. 이런 능력을 학습하려면 실제 소프트웨어에서 수집한 상호작용 궤적이 필요하지만, 애플리케이션 설치와 설정, 실행 환경 유지에는 상당한 비용이 든다. 사용할 수 있는 프로그램과 화면 상태, 작업 흐름도 실제 환경의 범위에 묶인다.

AutoGUIWorld는 이 문제를 시각적 시뮬레이션으로 우회한다. 핵심은 이미지 생성 모델을 시각적 월드 모델처럼 활용해, 소프트웨어를 직접 실행하지 않고도 특정 행동 뒤에 나타날 다음 화면을 생성하는 것이다.

작동 방식

  • 구조화된 장면 생성. 운영체제 맥락, 화면의 외관, 인터페이스 상태를 명세로 표현하고 이를 바탕으로 초기 GUI 장면을 샘플링한다.
  • 플래너 기반 작업 설계. 플래너는 작업을 원자적 행동으로 나누고, 각 행동 뒤에 어떤 시각적 변화가 나타나야 하는지도 지정한다. 행동 좌표와 화면 상태 변화를 연결하는 방식이다.
  • 스크린샷의 반복 편집. 이미지 생성기는 현재 스크린샷을 입력으로 받아 행동 이후의 다음 관찰 화면을 만든다. 이 과정을 반복해 여러 단계의 상호작용 궤적을 구성한다.
  • 행동 정렬과 품질 필터링. 행동 grounding과 전이 단위의 품질 검사를 적용해 공간 주석이 포함된 단계별 샘플을 선별한다. 보고된 데이터셋은 Ubuntu, Windows, macOS, Chrome을 포함하며 79,266개 샘플로 구성된다.

결과와 의미

연구진은 AutoGUIWorld 궤적으로 Qwen3.5-35B-A3B를 미세 조정했다. OSWorld의 평균 작업 점수는 33.0%에서 40.8%로 올랐고, ScienceBoard의 작업 성공률은 14.0%에서 32.2%로 상승했다. 이는 합성된 시각적 전이가 행동, 화면 변화, 작업 상태의 관계를 학습하는 데 유용한 신호가 될 수 있음을 보여준다.

이 연구의 중요한 점은 GUI 데이터 생성의 전제조건을 바꾼 데 있다. 모든 애플리케이션을 직접 실행하는 대신, 원하는 초기 장면과 전이를 지정해 데이터의 범위를 확장할 수 있다. 설치가 어렵거나 대규모 실행 비용이 높은 전문 소프트웨어, 서로 다른 운영체제의 인터페이스를 다루는 데이터 제작에도 새로운 선택지를 제공한다.

한계와 과제

화면이 자연스럽게 보인다고 해서 실제 애플리케이션의 논리까지 재현되는 것은 아니다. 권한 오류, 로딩 지연, 예외적인 대화상자, 장기 상태의 일관성처럼 이미지 생성만으로는 충분히 표현하기 어려운 요소가 있다. 따라서 AutoGUIWorld는 실제 상호작용 데이터와 환경 평가를 완전히 대체하기보다는 보완하는 방법으로 보는 편이 합리적이다. 향후에는 생성된 화면 전이를 실제 소프트웨어의 동작과 얼마나 정밀하게 맞출 수 있는지가 핵심 과제가 될 것이다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
Physis-Lang, 진화하는 물리 언어로 비디오 월드 모델 개선
월드 모델
cctest.ai
월드 모델

Physis-Lang, 진화하는 물리 언어로 비디오 월드 모델 개선

NVIDIA 연구진이 객체, 원인, 상호작용, 시간적 변화와 결과를 설명하는 물리 언어를 데이터 정제·모델 학습·비디오 생성의 공통 표현으로 사용하는 Physis-Lang을 제안했습니다. 원자적 주장 평가와 언어 기반 검색을 통해 물리적으로 더 타당한 영상을 생성하는 것이 목표입니다.

더 보기
CCTest · Blog
세계 행동 모델의 일반화를 만드는 것은 미래의 완전한 생성이 아니다
월드 모델
cctest.ai
월드 모델

세계 행동 모델의 일반화를 만드는 것은 미래의 완전한 생성이 아니다

새로운 실증 연구는 세계 행동 모델이 추론 단계에서 미래 영상을 끝까지 생성하지 않아도 일반화 성능의 이점을 유지할 수 있음을 시사한다. 핵심은 행동을 결정하기 전에 미래 표현을 준비하는 과정이다.

더 보기