아티클 목록으로
AI 에이전트

HybridCUA, GUI와 CLI를 오가는 컴퓨터 사용 에이전트 학습

약 3분 소요

배경

컴퓨터 사용 에이전트는 화면을 보고 클릭하거나 입력하면서 실제 소프트웨어 환경의 작업을 수행하는 방향으로 발전하고 있다. 그러나 현재 많은 에이전트는 그래픽 사용자 인터페이스(GUI)에만 의존한다. GUI는 여러 애플리케이션에 폭넓게 적용할 수 있다는 장점이 있지만, 화면 요소를 찾고 반복해서 클릭해야 하므로 처리 속도가 느려질 수 있다. 화면 배치가 조금만 바뀌어도 위치를 잘못 판단할 가능성도 있다.

반대로 애플리케이션별 API나 전용 도구를 연결하면 효율을 높일 수 있지만, 각 애플리케이션에 맞춘 개발과 유지보수가 필요하다. 이러한 방식은 지원 범위를 넓히기 어렵다는 한계도 가진다. HybridCUA는 GUI의 범용성과 명령줄 인터페이스(CLI)의 효율성을 하나의 에이전트 안에서 결합하는 접근을 제시한다.

핵심은 CLI를 제공하는 것이 아니라 조율하는 것

터미널 사용 권한을 모델에 추가하는 것만으로는 충분하지 않다. 에이전트는 언제 CLI를 사용해야 하는지, 어떤 명령을 실행해야 하는지, 명령의 결과를 다음 GUI 행동과 어떻게 연결할지를 판단해야 한다. 시각적 상태를 확인하거나 화면 요소를 조작하는 작업에는 GUI가 적합할 수 있고, 파일 관리나 반복적인 처리처럼 셸 명령으로 표현하기 쉬운 작업에는 CLI가 더 효율적일 수 있다.

연구진은 GUI만 사용하는 궤적, CLI만 사용하는 궤적, GUI와 CLI를 교차 사용하는 궤적이라는 세 가지 데이터를 구성했다. 이 파이프라인을 통해 5K개의 하이브리드 궤적과 3K개의 검증된 RLVR 작업으로 구성된 HybridCUA-8K를 만들었다. 따라서 모델은 단순히 사용할 수 있는 도구 목록을 학습하는 것이 아니라, 서로 다른 실행 경로와 도구 전환 방식을 함께 접하게 된다.

학습은 두 단계로 이뤄진다. 먼저 구성된 궤적을 사용해 지도 미세조정을 진행한다. 다음으로 CLI 사용을 고려하는 보상 설계를 포함한 온라인 강화학습을 적용한다. 이 보상은 CLI를 무조건 많이 호출하도록 하는 것이 아니라, 실제로 이점이 있는 상황에서 선택적으로 사용하고 안정적인 결과를 내도록 유도한다. 불필요한 터미널 호출은 새로운 오류를 만들 수 있기 때문에 사용 빈도보다 사용 판단이 중요하다.

결과와 의미

HybridCUA-9B는 OSWorld에서 53.6%의 정확도를 달성해 기본 모델보다 14.8%포인트 높은 결과를 보였다. WindowsAgentArena에서도 성능이 4.0%포인트 개선됐다. 공개된 내용에 따르면, 이 결과는 GUI와 CLI를 함께 학습시키는 방식이 컴퓨터 사용 에이전트의 수행 능력을 높이고 여러 플랫폼으로 확장될 가능성을 보여준다.

이 연구가 주는 가장 큰 시사점은 도구 선택을 부수적인 기능이 아니라 에이전트의 핵심 능력으로 봐야 한다는 점이다. GUI가 필요한 단계와 짧은 명령으로 빠르게 처리할 수 있는 단계를 구분하면, 특정 애플리케이션에 종속되지 않으면서도 실행 효율을 높일 수 있다.

다만 제공된 자료에는 세부 작업별 결과, 실패 사례, CLI 전략별 제거 실험이 포함돼 있지 않다. 따라서 현재 결과는 전체 접근법의 유효성을 보여주는 근거로 해석하는 것이 적절하며, 더 다양한 애플리케이션과 운영체제에서의 안정성은 추가 검증이 필요하다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
Raven: 진화하는 에이전트 하니스를 조합하는 시스템
AI 에이전트
cctest.ai
AI 에이전트

Raven: 진화하는 에이전트 하니스를 조합하는 시스템

Raven은 모델과 도메인별 전용 에이전트 하니스를 자동으로 만들고 개선한 뒤 서로 조합하는 ‘하니스의 하니스’를 제안합니다. 장기·跨도메인 작업을 단일 에이전트가 아닌 모듈형 협업 문제로 재정의하려는 접근입니다.

더 보기
CCTest · Blog
LongCat-DeepResearch가 제시한 협업형 멀티에이전트 연구 워크플로
AI 에이전트
cctest.ai
AI 에이전트

LongCat-DeepResearch가 제시한 협업형 멀티에이전트 연구 워크플로

LongCat-DeepResearch는 개선된 LongCat 모델과 멀티에이전트 워크플로를 결합해 근거 기반 연구 보고서 생성을 시도한다. 여러 평가에서 높은 성과를 보였지만, 계획을 더 추가한다고 항상 품질이 향상되는 것은 아니라는 점도 확인됐다.

더 보기