아티클 목록으로
AI 에이전트

Inherit-MAS, 워크플로와 실행을 상속하는 멀티에이전트 진화

약 4분 소요

들어가며

멀티에이전트 시스템의 어려움은 여러 대규모 언어 모델을 함께 배치하는 데서 끝나지 않는다. 각 에이전트에 어떤 역할을 맡길지, 어떤 정보를 주고받게 할지, 도구 사용을 어디까지 허용할지, 실패한 뒤 어느 부분을 고칠지까지 정해야 한다. 미리 설계한 워크플로는 복잡한 상황에 대응하지 못할 수 있고, 반대로 테스트 시점마다 전체 구조를 다시 만들면 이미 효과가 있었던 구성까지 사라질 수 있다. 바뀌지 않은 작업을 매번 처음부터 실행하는 경우에는 모델 호출과 도구 호출이 중복되는 비용도 발생한다.

arXiv 논문에서 제안한 Inherit-MAS는 이 문제를 상속과 선택의 관점에서 다룬다. 매 라운드마다 완전히 새로운 시스템을 생성하는 대신, 가장 최근에 완료된 후보를 출발점으로 삼고 평가 결과에 따라 필요한 부분만 수정한다. 동시에 조건이 맞는 과거 실행 결과를 재사용해 반복 계산을 줄인다.

핵심 구조

  • 생성과 평가의 분리. 메타 모델은 여러 워커 에이전트로 구성된 워크플로를 합성한다. 각 에이전트에는 역할, 통신 입력, 도구 권한이 명시된다. 실행이 끝나면 별도로 프롬프트된 판정 모델이 후보를 점수화하고 부족한 점을 진단한다.
  • 워크플로 상속. 일반적인 개선 라운드는 새 구조를 무작위로 만드는 대신 최신 완료 후보에서 시작한다. 도움이 되지 않는 것으로 판단된 삭제 가능 노드를 제거하고, 진단된 문제를 해결하기 위한 검증된 편집을 적용한다.
  • 실행 상속. 새로운 후보를 실행할 때 저장된 결과를 무조건 복사하지 않는다. 완전히 해결된 요청과 실행 맥락이 모두 일치할 때만 해당 결과를 상속한다. 이 조건은 서로 다른 상황에서 나온 낡은 결과가 잘못 재사용되는 것을 막기 위한 장치다.
  • 국소적 변화. 워크플로 구조의 수정과 실행 결과의 재사용을 분리함으로써, 시스템은 필요한 부분만 바꾸고 영향받지 않은 호출은 다시 수행하지 않을 수 있다.

실험에서 보고된 결과

GPT-4o-mini를 워커로 사용했을 때 Inherit-MAS는 WorkBench에서 55.4%의 completion, HotpotQA FullWiki에서 49.7%의 joint F1을 기록했다고 저자들은 보고한다. 논문에 따르면 EvoAgent, EvoMAS, TacoMAS를 포함한 진화형 멀티에이전트 기준선보다 높은 결과다. Qwen3-32B를 워커로 사용한 설정에서도 두 벤치마크 모두에서 해당 기준선들을 앞섰다고 제시한다.

실행 상속을 끄고 같은 컨트롤러를 다시 실행한 설정과 비교하면, 워커 토큰 사용량은 WorkBench에서 29.1%, HotpotQA에서 34.6% 감소했다. 전체 토큰 사용량 감소폭은 각각 5.3%와 18.1%였다. 워커 토큰과 전체 토큰 사이에 차이가 있다는 점은 워크플로 생성과 결과 판정 같은 다른 구성 요소도 총비용에 영향을 준다는 것을 보여준다.

의미와 남은 질문

Inherit-MAS의 핵심적인 관점은 테스트 시점의 개선을 전체 재생성이 아니라 진단, 국소 편집, 검증, 선택의 반복으로 보는 데 있다. 여러 차례 시도가 필요한 에이전트 시스템에서는 워크플로가 불필요하게 흔들리는 것을 줄이고, 비용이 큰 모델 및 도구 호출을 절약할 가능성이 있다. 요청과 실행 맥락을 엄격하게 비교하는 규칙은 결과 재사용의 안전성을 높이는 요소다.

다만 제공된 자료만으로는 두 상속 메커니즘의 독립적인 기여도, 편집이 실패한 사례, 판정 모델의 편향을 구체적으로 확인하기 어렵다. 실제 효과는 재사용 가능한 결과의 비율과 워크플로 규모, 판정 비용에 따라 달라질 수 있다. 그럼에도 이 연구는 진화하는 에이전트 시스템을 설계할 때 유용한 원칙을 제시한다. 가능한 한 국소적으로 수정하고, 재사용은 엄격한 조건 아래에서 수행하며, 다음 변화는 실제 실행 피드백에 근거해야 한다.

출처: arXiv

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
LLM 에이전트는 왜 특정 출처를 선호하는가
AI 에이전트
cctest.ai
AI 에이전트

LLM 에이전트는 왜 특정 출처를 선호하는가

쇼핑, 호텔, 학술 검색을 대상으로 한 연구에서 LLM 에이전트가 후보의 적합도뿐 아니라 상품과 정보의 출처에도 체계적인 선호를 보이는 것으로 나타났습니다. 출처를 가리거나 부족한 정보를 보완하고, 출처 기반 추론을 막는 지시를 주면 이러한 영향이 줄어듭니다.

더 보기
CCTest · Blog
DeskForge, 제어 가능한 데스크톱 환경으로 컴퓨터 사용 에이전트 학습
AI 에이전트
cctest.ai
AI 에이전트

DeskForge, 제어 가능한 데스크톱 환경으로 컴퓨터 사용 에이전트 학습

DeskForge는 실제 애플리케이션에 스크린샷, 접근성 트리, 창 기하 정보를 결합해 컴퓨터 사용 에이전트를 위한 조밀한 감독 신호를 생성한다. GUI 대상 지정 성능뿐 아니라 장기 작업 수행에서도 개선 효과가 보고됐다.

더 보기
CCTest · Blog
행동 전에 비교하기: 장기 도구 사용 에이전트의 가치 추정
AI 에이전트
cctest.ai
AI 에이전트

행동 전에 비교하기: 장기 도구 사용 에이전트의 가치 추정

장기적인 도구 사용에서 중요한 것은 다음 호출이 당장 타당한지뿐 아니라 최종 과제 성공에 도움이 되는지 판단하는 일입니다. CITA는 실행 전에 후보 도구 호출의 장기 가치를 비교하는 방법을 제안합니다.

더 보기