아티클 목록으로
AI 에이전트

DeskForge, 제어 가능한 데스크톱 환경으로 컴퓨터 사용 에이전트 학습

약 3분 소요

들어가며

컴퓨터 사용 에이전트가 명령을 이해하는 것만으로는 충분하지 않다. 여러 애플리케이션과 겹친 창, 서로 비슷하게 생긴 버튼이 한 화면에 나타나면 에이전트는 다음에 클릭하거나 입력해야 할 대상을 정확히 찾아야 한다. DeskForge는 정적인 스크린샷에만 의존하지 않고, 데스크톱 상태를 제어하면서 행동과 결과를 함께 기록하는 환경을 통해 이 문제를 다루는 데이터 생성 방식을 제시한다.

핵심 내용

  • 실제 앱을 제어 가능한 방식으로 구성한다. DeskForge는 실제 데스크톱 애플리케이션을 조합하고, 앱 상태와 콘텐츠, 창 배치, 화면 외관, 해상도를 바꾼다. 실제 소프트웨어의 복잡성을 유지하면서도 어려운 조건을 체계적으로 생성할 수 있다.
  • 여러 정보원을 결합해 조밀하게 주석을 단다. 스크린샷에 접근성 트리와 창의 기하 정보를 결합해 화면 요소와 위치를 기록한다. 최종 클릭 지점 하나만 표시하는 데이터보다 다양한 조작 후보를 더 풍부하게 표현할 수 있다.
  • 행동 결과까지 저장한다. 에이전트가 실행한 각 행동과 그 결과를 기록하므로, 화면에서 대상을 찾는 과정과 실제 조작 성공 여부를 연결할 수 있다.
  • 대규모 데이터셋을 제공한다. DeskForge-1M에는 120만 개의 주석 데스크톱 관측과 1억 5,970만 개의 요소 인스턴스가 들어 있다. 연구진은 이 중 20만 개의 grounding 예제로 네 개의 비전언어 모델을 미세 조정했다.
  • 외부 평가에서도 개선됐다. 논문에 따르면 네 모델 모두 학습에 포함되지 않은 데스크톱 조건과 다섯 개의 외부 GUI grounding 벤치마크에서 성능이 올랐다. Qwen3.5-4B는 ScreenSpot-Pro에서 11.51%포인트, OSWorld-G에서 10.11%포인트 향상됐다.

의미와 한계

DeskForge의 핵심 기여는 단순히 데이터 양을 늘린 데 있지 않다. 데스크톱 조작에서 어려운 상황을 통제 가능한 요소로 분해하고, 이를 반복적으로 생성할 수 있게 했다는 점이 중요하다. 사람이 수집한 시연이나 개별 화면 이미지 만으로는 창 가림, 레이아웃 변화, 해상도 차이, 유사한 컨트롤의 경쟁을 충분히 조합하기 어렵다. 애플리케이션 상태와 화면 구조를 함께 다루면 에이전트가 취약한 상황을 겨냥한 학습 사례를 만들 수 있다.

효과는 한 번의 대상 지정에만 머물지 않았다. 고정된 플래너를 사용한 장기 평가에서 DeskForge로 미세 조정한 모델은 WebArena-Infinity와 OpenApps의 더 많은 작업을 해결했다. Qwen3.5-4B의 성공 과제는 WebArena-Infinity에서 119개 중 31개에서 50개로, OpenApps에서는 100개 중 3개에서 15개로 증가했다. 개별 단계의 위치 지정이 좋아지면 긴 작업 흐름 전체의 성공률에도 누적 효과가 나타날 수 있음을 시사한다.

다만 이 결과는 제안된 데이터와 학습 방식의 효과를 보여주는 것이지, 데스크톱 에이전트의 신뢰성이 완전히 해결됐다는 뜻은 아니다. 애플리케이션 버전 변화, 예외적인 화면 상태, 여러 앱을 넘나드는 작업은 여전히 새로운 분포 차이를 만들 수 있다. 프레임워크와 데이터셋, 미세 조정 모델의 공개는 재현 실험과 후속 학습 전략 비교를 위한 기반을 제공한다.

arXiv

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
LLM 에이전트는 왜 특정 출처를 선호하는가
AI 에이전트
cctest.ai
AI 에이전트

LLM 에이전트는 왜 특정 출처를 선호하는가

쇼핑, 호텔, 학술 검색을 대상으로 한 연구에서 LLM 에이전트가 후보의 적합도뿐 아니라 상품과 정보의 출처에도 체계적인 선호를 보이는 것으로 나타났습니다. 출처를 가리거나 부족한 정보를 보완하고, 출처 기반 추론을 막는 지시를 주면 이러한 영향이 줄어듭니다.

더 보기
CCTest · Blog
행동 전에 비교하기: 장기 도구 사용 에이전트의 가치 추정
AI 에이전트
cctest.ai
AI 에이전트

행동 전에 비교하기: 장기 도구 사용 에이전트의 가치 추정

장기적인 도구 사용에서 중요한 것은 다음 호출이 당장 타당한지뿐 아니라 최종 과제 성공에 도움이 되는지 판단하는 일입니다. CITA는 실행 전에 후보 도구 호출의 장기 가치를 비교하는 방법을 제안합니다.

더 보기