Inherit-MAS, 워크플로와 실행을 상속하는 멀티에이전트 진화
들어가며
멀티에이전트 시스템의 어려움은 여러 대규모 언어 모델을 함께 배치하는 데서 끝나지 않는다. 각 에이전트에 어떤 역할을 맡길지, 어떤 정보를 주고받게 할지, 도구 사용을 어디까지 허용할지, 실패한 뒤 어느 부분을 고칠지까지 정해야 한다. 미리 설계한 워크플로는 복잡한 상황에 대응하지 못할 수 있고, 반대로 테스트 시점마다 전체 구조를 다시 만들면 이미 효과가 있었던 구성까지 사라질 수 있다. 바뀌지 않은 작업을 매번 처음부터 실행하는 경우에는 모델 호출과 도구 호출이 중복되는 비용도 발생한다.
arXiv 논문에서 제안한 Inherit-MAS는 이 문제를 상속과 선택의 관점에서 다룬다. 매 라운드마다 완전히 새로운 시스템을 생성하는 대신, 가장 최근에 완료된 후보를 출발점으로 삼고 평가 결과에 따라 필요한 부분만 수정한다. 동시에 조건이 맞는 과거 실행 결과를 재사용해 반복 계산을 줄인다.
핵심 구조
- 생성과 평가의 분리. 메타 모델은 여러 워커 에이전트로 구성된 워크플로를 합성한다. 각 에이전트에는 역할, 통신 입력, 도구 권한이 명시된다. 실행이 끝나면 별도로 프롬프트된 판정 모델이 후보를 점수화하고 부족한 점을 진단한다.
- 워크플로 상속. 일반적인 개선 라운드는 새 구조를 무작위로 만드는 대신 최신 완료 후보에서 시작한다. 도움이 되지 않는 것으로 판단된 삭제 가능 노드를 제거하고, 진단된 문제를 해결하기 위한 검증된 편집을 적용한다.
- 실행 상속. 새로운 후보를 실행할 때 저장된 결과를 무조건 복사하지 않는다. 완전히 해결된 요청과 실행 맥락이 모두 일치할 때만 해당 결과를 상속한다. 이 조건은 서로 다른 상황에서 나온 낡은 결과가 잘못 재사용되는 것을 막기 위한 장치다.
- 국소적 변화. 워크플로 구조의 수정과 실행 결과의 재사용을 분리함으로써, 시스템은 필요한 부분만 바꾸고 영향받지 않은 호출은 다시 수행하지 않을 수 있다.
실험에서 보고된 결과
GPT-4o-mini를 워커로 사용했을 때 Inherit-MAS는 WorkBench에서 55.4%의 completion, HotpotQA FullWiki에서 49.7%의 joint F1을 기록했다고 저자들은 보고한다. 논문에 따르면 EvoAgent, EvoMAS, TacoMAS를 포함한 진화형 멀티에이전트 기준선보다 높은 결과다. Qwen3-32B를 워커로 사용한 설정에서도 두 벤치마크 모두에서 해당 기준선들을 앞섰다고 제시한다.
실행 상속을 끄고 같은 컨트롤러를 다시 실행한 설정과 비교하면, 워커 토큰 사용량은 WorkBench에서 29.1%, HotpotQA에서 34.6% 감소했다. 전체 토큰 사용량 감소폭은 각각 5.3%와 18.1%였다. 워커 토큰과 전체 토큰 사이에 차이가 있다는 점은 워크플로 생성과 결과 판정 같은 다른 구성 요소도 총비용에 영향을 준다는 것을 보여준다.
의미와 남은 질문
Inherit-MAS의 핵심적인 관점은 테스트 시점의 개선을 전체 재생성이 아니라 진단, 국소 편집, 검증, 선택의 반복으로 보는 데 있다. 여러 차례 시도가 필요한 에이전트 시스템에서는 워크플로가 불필요하게 흔들리는 것을 줄이고, 비용이 큰 모델 및 도구 호출을 절약할 가능성이 있다. 요청과 실행 맥락을 엄격하게 비교하는 규칙은 결과 재사용의 안전성을 높이는 요소다.
다만 제공된 자료만으로는 두 상속 메커니즘의 독립적인 기여도, 편집이 실패한 사례, 판정 모델의 편향을 구체적으로 확인하기 어렵다. 실제 효과는 재사용 가능한 결과의 비율과 워크플로 규모, 판정 비용에 따라 달라질 수 있다. 그럼에도 이 연구는 진화하는 에이전트 시스템을 설계할 때 유용한 원칙을 제시한다. 가능한 한 국소적으로 수정하고, 재사용은 엄격한 조건 아래에서 수행하며, 다음 변화는 실제 실행 피드백에 근거해야 한다.
출처: arXiv
댓글
로그인 상태 확인 중…
댓글 불러오는 중…