아티클 목록으로
AI 에이전트

RecreationWorld, 소프트웨어 재현으로 컴퓨터 사용 에이전트를 평가하다

약 3분 소요

배경

컴퓨터 사용 에이전트 연구는 크게 두 방향으로 발전해 왔습니다. 하나는 클릭, 입력, 화면 인식을 통해 그래픽 인터페이스를 조작하는 방식이고, 다른 하나는 코드와 터미널, 개발 도구를 이용해 소프트웨어를 작성하는 방식입니다. 그러나 실제 디지털 업무에서는 두 능력이 분리되지 않습니다. 애플리케이션을 관찰한 뒤 구현하고, 실행 결과를 화면으로 확인하면서 다시 수정하는 과정이 반복되기 때문입니다.

RecreationWorld는 이 과정을 하나의 과제로 묶습니다. 에이전트는 실행 중인 참조 애플리케이션을 받지만, 구체적인 작업 순서는 제공받지 않습니다. 먼저 기능과 동작을 탐색하고, 참조와 최대한 유사한 구현을 만든 다음, 실행과 시각적 검증으로 문제를 찾아야 합니다. 따라서 핵심은 코드를 생성하는 것만이 아니라 탐색, 개발, 검증을 지속적으로 연결하는 데 있습니다.

주요 구성

  • 다섯 플랫폼 지원. Ubuntu, macOS, Windows, Android, Web을 대상으로 하며 네이티브 GUI 제어와 코딩 도구를 하나의 하네스에서 제공합니다.
  • 참조 애플리케이션을 행동 기준으로 활용. 실행 중인 참조를 바탕으로 숨겨진 행동 테스트와 실행 기반 보상을 구성합니다. 코드가 그럴듯해 보이는 것만으로는 충분하지 않습니다.
  • 오픈소스 애플리케이션으로 학습 궤적 확장. 고품질 오픈소스 소프트웨어를 이용해 학습 데이터를 만들고, 재현 과제 밖의 코딩 및 혼합형 컴퓨터 사용 과제로 기술이 전이되는지 확인합니다.
  • 프로그램과 시각 결과를 함께 평가. RecreationBench는 여러 분야와 플랫폼의 250개 과제로 구성됩니다. 다양한 상호작용 깊이에서 상태 변화를 프로그램 단정문과 시각 단정문으로 검사하며, 테스트는 참조 애플리케이션에서 검증되고 사람의 검토를 거쳐 고정됩니다.

결과가 보여주는 한계

보고된 평가에서 GPT-6 Astra는 58.1%의 전체 점수로 가장 앞섰습니다. 하지만 모든 프로그램 테스트를 통과한 과제는 2.8%에 불과했습니다. 이는 화면이 비슷하게 보이는 것과 애플리케이션의 실제 동작을 재현하는 것이 전혀 다른 문제임을 보여줍니다. 에이전트는 정적인 인터페이스 구조는 비교적 잘 복제하지만, 상호작용과 계산 결과에서는 더 불안정합니다. 생성된 애플리케이션도 참조보다 규모가 작고 단일 구조로 구성되는 경향을 보였습니다.

관련 궤적으로 학습한 모델은 다섯 개의 분포 밖 코딩 및 하이브리드 컴퓨터 사용 벤치마크에서 향상됐으며, 렌더링된 결과를 확인하는 빈도도 높아졌습니다. 검증 행동이 다른 과제로 전이될 가능성을 보여주는 결과지만, 복잡한 소프트웨어 재현의 어려움이 사라졌다는 의미는 아닙니다.

의미와 영향

RecreationWorld는 단일 클릭이나 코드 완성보다 “관찰, 구현, 실행, 검증”이라는 전체 작업 순환을 평가의 중심에 둡니다. 에이전트의 신뢰성을 판단하려면 최종 화면이나 한 번의 성공 여부뿐 아니라 상태 변화, 연속 상호작용, 계산 출력이 참조와 일치하는지도 확인해야 합니다.

환경과 벤치마크, 테스트 모음이 공개되면서 운영체제와 애플리케이션 유형을 넘나드는 비교가 쉬워질 수 있습니다. 향후 컴퓨터 사용 에이전트 연구에서는 자연스럽게 조작하는 능력뿐 아니라, 의도한 동작을 실제로 재현했음을 입증하는 능력이 더욱 중요해질 전망입니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
MintAct: 디지털 환경을 아우르는 통합 비주얼 에이전트
AI 에이전트
cctest.ai
AI 에이전트

MintAct: 디지털 환경을 아우르는 통합 비주얼 에이전트

MintAct는 UI 위치 지정, 다단계 내비게이션, 시각적 도구 사용을 하나의 비전-언어 모델 계열로 통합하려는 연구입니다. 핵심은 모델 자체뿐 아니라 모바일·데스크톱·웹 환경을 함께 학습시키는 확장형 인프라와 비동기 강화학습에 있습니다.

더 보기