AgentWorld, 장기 과제로 다중 에이전트 협업 능력을 시험하다
서론
여러 대규모 언어 모델을 하나의 팀처럼 배치하면 더 복잡한 문제를 해결할 수 있을까? 기존 다중 에이전트 벤치마크는 이 질문에 충분한 답을 제공하기 어려웠다. 경쟁 중심의 환경이나 20단계 미만의 짧은 상호작용을 다루는 경우가 많았고, 에이전트별 성능을 합산하는 데 그치는 평가도 적지 않았다. 그 결과 장기간에 걸친 역할 분담과 조정이 실제로 작동했는지 확인하기 어려웠다.
AgentWorld는 MMORPG형 샌드박스를 활용해 이 문제를 다룬다. 과제는 50라운드 이상 이어질 수 있으며, 3~20개의 에이전트가 서로 다른 역할과 능력을 가지고 참여한다. 에이전트는 다른 구성원의 내부 상태를 직접 볼 수 없는 블랙박스 환경에서 행동한다. 따라서 목표, 자원, 진행 상황, 다음 행동을 통신으로 공유하고 공동 계획을 계속 갱신해야 한다.
핵심 내용
- 장기 협업을 평가한다. 사람이 주석을 단 100개 과제와 100개의 증강 변형 과제를 제공하며, 짧은 의사결정이 아니라 지속적인 소통, 공동 계획, 자원 공유를 요구한다.
- 역할과 능력이 비대칭적이다. 에이전트마다 담당 업무와 사용할 수 있는 능력이 다르기 때문에, 팀은 역할 경계를 파악하고 작업을 적절히 배분해야 한다. 상황이 바뀌면 기존 분담도 조정해야 한다.
- 성공 여부를 넘어 협업의 기여도를 측정한다. 인과적 협업 효과성(CCE)은 에이전트 행동 사이의 인과적 의존성을 그래프로 추적해 팀의 노력 중 실제 결과에 기여한 비율을 분석하려는 지표다.
- 공동 계획 유지가 여전히 어렵다. Gemini 3 Flash, Claude Haiku 4.5, GPT-5 Mini, DeepSeek R1-70B를 대상으로 한 실험에서 최고 모델의 과제 성공률도 52.0%에 그쳤다. 대표적인 실패 유형은 통신 단절, 역할 혼동, 여러 라운드에 걸친 공동 계획 유지 실패였다.
의미와 영향
AgentWorld의 핵심 가치는 게임 환경 자체보다 협업의 질을 평가 대상으로 삼았다는 데 있다. 팀이 과제를 완료했더라도 일부 에이전트의 우연한 행동에 의존했거나, 불필요한 작업을 반복했을 수 있다. CCE는 행동 간 연결을 분석해 어떤 행동이 결과를 전진시켰는지, 팀의 투입 중 실제로 유효했던 부분이 어느 정도인지 살펴볼 수 있는 방법을 제시한다.
이 결과는 단일 에이전트의 능력과 팀을 운영하는 능력이 다르다는 점도 보여준다. 성능이 높은 모델이라도 공동 상태를 지속적으로 갱신하고, 다른 에이전트의 역할을 이해하며, 핵심 정보를 전달하고, 계획이 틀어졌을 때 수정하는 일은 쉽지 않다. 향후 다중 에이전트 시스템에서는 더 강한 기반 모델뿐 아니라 통신 규약, 공유 메모리, 진행 상황 추적, 실패 복구 기능이 중요해질 가능성이 크다.
다만 AgentWorld는 통제된 MMORPG 샌드박스를 중심으로 하므로, 결과를 현실 조직이나 실제 업무 환경에 그대로 적용해서는 안 된다. 그럼에도 평가 기준을 “팀이 성공했는가”에서 “어떻게 성공했고 어떤 행동이 실제로 기여했는가”로 확장했다는 점에서, 더 신뢰할 수 있고 설명 가능한 협업 에이전트를 연구하는 출발점이 될 수 있다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…