DeskForge, 제어 가능한 데스크톱 환경으로 컴퓨터 사용 에이전트 학습
들어가며
컴퓨터 사용 에이전트가 명령을 이해하는 것만으로는 충분하지 않다. 여러 애플리케이션과 겹친 창, 서로 비슷하게 생긴 버튼이 한 화면에 나타나면 에이전트는 다음에 클릭하거나 입력해야 할 대상을 정확히 찾아야 한다. DeskForge는 정적인 스크린샷에만 의존하지 않고, 데스크톱 상태를 제어하면서 행동과 결과를 함께 기록하는 환경을 통해 이 문제를 다루는 데이터 생성 방식을 제시한다.
핵심 내용
- 실제 앱을 제어 가능한 방식으로 구성한다. DeskForge는 실제 데스크톱 애플리케이션을 조합하고, 앱 상태와 콘텐츠, 창 배치, 화면 외관, 해상도를 바꾼다. 실제 소프트웨어의 복잡성을 유지하면서도 어려운 조건을 체계적으로 생성할 수 있다.
- 여러 정보원을 결합해 조밀하게 주석을 단다. 스크린샷에 접근성 트리와 창의 기하 정보를 결합해 화면 요소와 위치를 기록한다. 최종 클릭 지점 하나만 표시하는 데이터보다 다양한 조작 후보를 더 풍부하게 표현할 수 있다.
- 행동 결과까지 저장한다. 에이전트가 실행한 각 행동과 그 결과를 기록하므로, 화면에서 대상을 찾는 과정과 실제 조작 성공 여부를 연결할 수 있다.
- 대규모 데이터셋을 제공한다. DeskForge-1M에는 120만 개의 주석 데스크톱 관측과 1억 5,970만 개의 요소 인스턴스가 들어 있다. 연구진은 이 중 20만 개의 grounding 예제로 네 개의 비전언어 모델을 미세 조정했다.
- 외부 평가에서도 개선됐다. 논문에 따르면 네 모델 모두 학습에 포함되지 않은 데스크톱 조건과 다섯 개의 외부 GUI grounding 벤치마크에서 성능이 올랐다. Qwen3.5-4B는 ScreenSpot-Pro에서 11.51%포인트, OSWorld-G에서 10.11%포인트 향상됐다.
의미와 한계
DeskForge의 핵심 기여는 단순히 데이터 양을 늘린 데 있지 않다. 데스크톱 조작에서 어려운 상황을 통제 가능한 요소로 분해하고, 이를 반복적으로 생성할 수 있게 했다는 점이 중요하다. 사람이 수집한 시연이나 개별 화면 이미지 만으로는 창 가림, 레이아웃 변화, 해상도 차이, 유사한 컨트롤의 경쟁을 충분히 조합하기 어렵다. 애플리케이션 상태와 화면 구조를 함께 다루면 에이전트가 취약한 상황을 겨냥한 학습 사례를 만들 수 있다.
효과는 한 번의 대상 지정에만 머물지 않았다. 고정된 플래너를 사용한 장기 평가에서 DeskForge로 미세 조정한 모델은 WebArena-Infinity와 OpenApps의 더 많은 작업을 해결했다. Qwen3.5-4B의 성공 과제는 WebArena-Infinity에서 119개 중 31개에서 50개로, OpenApps에서는 100개 중 3개에서 15개로 증가했다. 개별 단계의 위치 지정이 좋아지면 긴 작업 흐름 전체의 성공률에도 누적 효과가 나타날 수 있음을 시사한다.
다만 이 결과는 제안된 데이터와 학습 방식의 효과를 보여주는 것이지, 데스크톱 에이전트의 신뢰성이 완전히 해결됐다는 뜻은 아니다. 애플리케이션 버전 변화, 예외적인 화면 상태, 여러 앱을 넘나드는 작업은 여전히 새로운 분포 차이를 만들 수 있다. 프레임워크와 데이터셋, 미세 조정 모델의 공개는 재현 실험과 후속 학습 전략 비교를 위한 기반을 제공한다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…