아티클 목록으로
AI 에이전트

MILO: 멀티 에이전트 진화로 Agent Harness 자동 탐색

약 3분 소요

들어가며

긴 작업을 수행하는 AI 에이전트의 성능은 언어 모델 하나만으로 결정되지 않습니다. 작업을 어떻게 계획하고, 도구를 호출하며, 실행 상태를 관리하고, 외부 환경과 상호작용하는지를 정하는 Harness도 핵심 요소입니다. 모델이 바뀔 때마다 기존 Harness를 사람이 다시 조정하는 과정은 많은 시간과 비용을 요구합니다. MILO(Meta-evolutionary Island Orchestration)는 이 문제를 자동화된 진화형 탐색으로 바꾸려 합니다.

MILO의 핵심 구성

  • 전체 Harness를 탐색한다: 기존 자동화 방법은 프롬프트나 스킬 등 특정 구성 요소만 최적화하는 경우가 많습니다. MILO의 변이 에이전트는 전체 Harness를 다시 작성해 구성 요소 간 조합 효과를 함께 평가합니다.
  • 탐색 계보를 기억한다: 후보들은 섬 형태의 계보 트리로 관리됩니다. 선택된 변경뿐 아니라 탈락한 변이도 부정적 증거로 저장해, 비효율적인 시도를 반복하지 않도록 합니다.
  • 탐색 방식도 진화시킨다: 오케스트레이터는 계보 이식, 종분화, 변이 에이전트 재배치, 탐색 커리큘럼 수정 등을 수행합니다. 따라서 검색 과정이 처음부터 끝까지 고정된 전략에 머물지 않습니다.
  • 여러 모델과 과제로 검증한다: 연구진은 Terminal-Bench 2.1, PaperBench, DeepSWE에서 Opus 4.8과 오픈 웨이트 모델 gpt-oss-120b를 사용해 MILO를 평가했습니다. 보고된 비교에서 MILO가 발견한 Harness는 8개의 선행 Harness와 6개의 탐색 방법을 앞섰습니다.

의미와 한계

Opus 4.8을 사용했을 때 초기 Harness 대비 해결률 향상 폭은 세 벤치마크에서 각각 12.0%, 28.3%, 10.3%였습니다. Terminal-Bench 2.1에서는 86.1±2.0%를 기록해, 비교 시점의 공식 리더보드 최고 기록인 83.8±2.3%보다 높은 수치를 보였습니다.

MILO의 중요한 점은 더 좋은 Harness뿐 아니라 더 나은 탐색 방법까지 찾으려 한다는 데 있습니다. Harness의 설계 공간이 커질수록 고정된 최적화 전략은 특정 패턴만 과도하게 추구하거나 비슷한 후보로 빠르게 수렴할 수 있습니다. 섬 구조는 서로 다른 탐색 경로를 유지하고, 계보 메모리는 성공과 실패의 경험을 다음 선택에 반영합니다.

물론 과제와 모델, 도구 환경이 달라졌을 때 성능이 그대로 이전되는지는 추가 검증이 필요합니다. 탐색 비용, 평가의 신뢰성, 복잡한 Harness의 해석 가능성도 남은 과제입니다. 그럼에도 MILO는 에이전트 개발이 사람이 고정된 실행 절차를 관리하는 방식에서, 에이전트가 자신의 운영 절차를 지속적으로 발견하고 개선하는 방식으로 이동할 수 있음을 보여줍니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
PatchHolmes, 리스트 비교 에이전트로 취약점 수정 커밋을 찾다
AI 에이전트
cctest.ai
AI 에이전트

PatchHolmes, 리스트 비교 에이전트로 취약점 수정 커밋을 찾다

PatchHolmes는 하이브리드 검색으로 후보를 좁힌 뒤 에이전트가 후보 목록 전체를 비교하도록 해 실제 취약점 수정 커밋을 선택한다. 개별 후보를 따로 판정하는 방식보다 높은 Top-1 검색 성능을 더 적은 대화 횟수로 달성했다.

더 보기
CCTest · Blog
검색 에이전트의 ‘상호 부정행위’: CrossFit이 자가 진화 오류를 줄이는 방법
AI 에이전트
cctest.ai
AI 에이전트

검색 에이전트의 ‘상호 부정행위’: CrossFit이 자가 진화 오류를 줄이는 방법

자가 진화 검색 에이전트는 서로의 같은 오류를 정답처럼 강화해 내부 보상만 높일 수 있다. CrossFit은 학습 데이터와 평가 경로의 출처를 분리해 이런 피드백 고리를 약화한다.

더 보기