아티클 목록으로
모델 평가

AgentWorld, 장기 과제로 다중 에이전트 협업 능력을 시험하다

약 3분 소요

서론

여러 대규모 언어 모델을 하나의 팀처럼 배치하면 더 복잡한 문제를 해결할 수 있을까? 기존 다중 에이전트 벤치마크는 이 질문에 충분한 답을 제공하기 어려웠다. 경쟁 중심의 환경이나 20단계 미만의 짧은 상호작용을 다루는 경우가 많았고, 에이전트별 성능을 합산하는 데 그치는 평가도 적지 않았다. 그 결과 장기간에 걸친 역할 분담과 조정이 실제로 작동했는지 확인하기 어려웠다.

AgentWorld는 MMORPG형 샌드박스를 활용해 이 문제를 다룬다. 과제는 50라운드 이상 이어질 수 있으며, 3~20개의 에이전트가 서로 다른 역할과 능력을 가지고 참여한다. 에이전트는 다른 구성원의 내부 상태를 직접 볼 수 없는 블랙박스 환경에서 행동한다. 따라서 목표, 자원, 진행 상황, 다음 행동을 통신으로 공유하고 공동 계획을 계속 갱신해야 한다.

핵심 내용

  • 장기 협업을 평가한다. 사람이 주석을 단 100개 과제와 100개의 증강 변형 과제를 제공하며, 짧은 의사결정이 아니라 지속적인 소통, 공동 계획, 자원 공유를 요구한다.
  • 역할과 능력이 비대칭적이다. 에이전트마다 담당 업무와 사용할 수 있는 능력이 다르기 때문에, 팀은 역할 경계를 파악하고 작업을 적절히 배분해야 한다. 상황이 바뀌면 기존 분담도 조정해야 한다.
  • 성공 여부를 넘어 협업의 기여도를 측정한다. 인과적 협업 효과성(CCE)은 에이전트 행동 사이의 인과적 의존성을 그래프로 추적해 팀의 노력 중 실제 결과에 기여한 비율을 분석하려는 지표다.
  • 공동 계획 유지가 여전히 어렵다. Gemini 3 Flash, Claude Haiku 4.5, GPT-5 Mini, DeepSeek R1-70B를 대상으로 한 실험에서 최고 모델의 과제 성공률도 52.0%에 그쳤다. 대표적인 실패 유형은 통신 단절, 역할 혼동, 여러 라운드에 걸친 공동 계획 유지 실패였다.

의미와 영향

AgentWorld의 핵심 가치는 게임 환경 자체보다 협업의 질을 평가 대상으로 삼았다는 데 있다. 팀이 과제를 완료했더라도 일부 에이전트의 우연한 행동에 의존했거나, 불필요한 작업을 반복했을 수 있다. CCE는 행동 간 연결을 분석해 어떤 행동이 결과를 전진시켰는지, 팀의 투입 중 실제로 유효했던 부분이 어느 정도인지 살펴볼 수 있는 방법을 제시한다.

이 결과는 단일 에이전트의 능력과 팀을 운영하는 능력이 다르다는 점도 보여준다. 성능이 높은 모델이라도 공동 상태를 지속적으로 갱신하고, 다른 에이전트의 역할을 이해하며, 핵심 정보를 전달하고, 계획이 틀어졌을 때 수정하는 일은 쉽지 않다. 향후 다중 에이전트 시스템에서는 더 강한 기반 모델뿐 아니라 통신 규약, 공유 메모리, 진행 상황 추적, 실패 복구 기능이 중요해질 가능성이 크다.

다만 AgentWorld는 통제된 MMORPG 샌드박스를 중심으로 하므로, 결과를 현실 조직이나 실제 업무 환경에 그대로 적용해서는 안 된다. 그럼에도 평가 기준을 “팀이 성공했는가”에서 “어떻게 성공했고 어떤 행동이 실제로 기여했는가”로 확장했다는 점에서, 더 신뢰할 수 있고 설명 가능한 협업 에이전트를 연구하는 출발점이 될 수 있다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
정적 점수를 넘어: 경쟁 게임으로 LLM을 평가하는 Game Arena
모델 평가
cctest.ai
모델 평가

정적 점수를 넘어: 경쟁 게임으로 LLM을 평가하는 Game Arena

Kaggle Game Arena는 체스, 포커, 늑대인간 게임에서 대규모 언어 모델을 경쟁시키며 계획 수립과 적응력, 불확실성 대응을 평가합니다. 고정된 문제집만으로는 확인하기 어려운 동적 의사결정 능력을 실전형 대국에서 살펴보려는 시도입니다.

더 보기
CCTest · Blog
LLM 심사관은 왜 실패하는가: Text-to-SQL 운영 감사의 교훈
모델 평가
cctest.ai
모델 평가

LLM 심사관은 왜 실패하는가: Text-to-SQL 운영 감사의 교훈

운영 중인 Text-to-SQL 파이프라인을 감사한 연구에서 LLM-as-Judge가 인간 평가와 크게 어긋나고, 올바른 SQL을 과도하게 문제로 분류하는 현상이 확인됐다. 단순히 모델을 늘리는 것보다 심사 모델 교체와 보수적인 라우팅이 효과적이었다.

더 보기