CompoWorld, 여러 서비스를 넘나드는 AI 에이전트 학습 제안
배경
현실의 업무 자동화는 하나의 애플리케이션 안에서 끝나는 경우가 드물다. 에이전트는 한 서비스에서 정보를 찾은 뒤 다른 서비스로 옮겨 변환하고, 그 결과를 다시 일정 관리나 프로젝트 도구에 입력해야 할 수 있다. 그러나 기존의 자동 생성 환경은 주로 단일 환경 내부의 작업을 다뤘다. CompoWorld는 여러 서비스가 연결되는 워크플로를 대규모로 만들기 위한 방법을 제시한다.
핵심 구성
CompoWorld의 전략은 모든 작업마다 새로운 환경을 만드는 것이 아니다. 재사용 가능한 서비스 집합을 먼저 구축한 뒤, 서비스 간 의존 관계를 조합해 다양한 작업을 생성한다.
- 검증된 서비스 구축: 코딩 에이전트가 도구 사양을 바탕으로 서비스를 구현한다. 각 서비스는 타입이 지정된 상태와 공통 인터페이스를 제공하므로, 다른 서비스와 연결하고 상태 변화를 확인하기 쉽다.
- 월드 모델 활용: 안정적으로 구현하기 어려운 도구는 월드 모델이 처리한다. 이를 통해 실제 외부 시스템을 모두 정밀하게 복제해야 하는 부담을 줄인다.
- 의존성 기반 작업 생성: 무작위 보행 절차가 서비스 사이에 의존성 그래프를 만든다. 에이전트는 단순히 여러 도구를 호출하는 데 그치지 않고, 중간 정보를 보존하고 변환한 뒤 후속 서비스에서 올바르게 사용해야 한다.
- 완료 중심의 보상: 검증된 궤적은 지도 미세조정에 사용된다. 강화학습에서는 Completion-Focused Rubric Reward를 적용해 각 롤아웃 그룹에서 통과율이 낮은 기준에 더 큰 관심을 둔다. 쉬운 단계만 수행하는 대신 전체 작업을 끝내도록 유도하는 방식이다.
연구팀은 448개 서비스를 구축하고 10,130개 도구를 제공했다. 이어 3K개의 지도 미세조정 궤적과 1K개의 강화학습 작업으로 Qwen3.6-35B-A3B를 훈련했다. 논문 초록에 따르면 이 방식은 8개 벤치마크에서 기반 모델 대비 평균 9.17점 향상을 보였다. AutomationBench에서는 Claude Opus 4.6을 포함한 프런티어 모델을 앞섰으며, 비교된 에이전트 특화 35B-A3B 모델 가운데서도 선두를 기록했다고 보고한다.
의미와 한계
CompoWorld의 핵심 의미는 환경의 규모를 한 애플리케이션 안의 작업 수로만 정의하지 않고, 서비스 조합과 의존성 구조의 다양성까지 확장했다는 데 있다. 인터페이스와 상태 전이가 명확하고 검증 가능한 서비스라면, 제한된 부품으로도 다양한 장기 작업을 생성할 수 있다.
이 접근은 정보 전달, 도구 조정, 엔드투엔드 완료 능력을 학습시키려는 연구에 유용한 방향을 제시한다. 다만 성능은 생성된 서비스의 품질, 월드 모델의 정확성, 자동 검증의 범위에 영향을 받는다. 이번 벤치마크 결과만으로 공개 웹 환경이나 실제 권한 관리, 고위험 업무에서의 신뢰성까지 입증됐다고 보기는 어렵다. 구현 세부 정보와 독립적인 재현 연구가 뒤따라야 한다. 그럼에도 CompoWorld는 고립된 도구 작업에서 여러 서비스가 연결된 워크플로 학습으로 나아가는 구체적인 경로를 보여준다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…