아티클 목록으로
AI 에이전트

AgentMercury, 검증 가능한 비즈니스 환경을 대규모로 합성하다

약 3분 소요

들어가며

현실의 업무를 수행하는 에이전트를 학습시키려면 벤치마크 문제마다 따로 만든 시뮬레이션만으로는 부족합니다. 기업의 업무 흐름은 고객, 주문, 재고, 권한, 결제, 지원 티켓 등 여러 시스템을 넘나들며, 한 서비스에서의 행동이 다른 서비스의 상태를 바꿀 수 있습니다. 실행 가능하고 결과를 검증할 수 있는 다양한 환경을 대규모로 마련하는 일은 에이전트 강화학습의 핵심 인프라 과제가 되고 있습니다.

AgentMercury는 “에이전트가 풀어야 할 단일 작업”을 먼저 만드는 대신, 지속적으로 변화하는 비즈니스 세계를 먼저 구축합니다.

핵심 내용

  • 작업 중심에서 세계 중심으로 전환. 고수준 비즈니스 시나리오를 바탕으로 엔터티, 서비스, 도구, 상태를 포함한 환경을 생성합니다. 작업은 고정된 유일한 목표가 아니라 세계의 상태와 전이에서 파생될 수 있습니다.
  • 서비스 간 불변 조건을 실행 가능하게 표현. 여러 서비스 사이의 업무 관계를 검사 가능한 제약으로 모델링합니다. 따라서 도구 호출이 응답을 반환했는지뿐 아니라, 행동이 업무 규칙을 훼손하지 않았는지도 확인할 수 있습니다.
  • 넓은 사업 범위를 지향. 연구진은 14개 산업과 50개 국가를 대상으로 4,783개의 실행 가능한 환경을 구축했습니다. 제공된 자료에는 각 환경의 세부 구성은 없지만, 하나의 벤치마크 영역을 넘어 다양한 업무 세계를 만들려는 방향은 분명합니다.
  • 도메인 밖 평가에서도 성과 보고. 평가 벤치마크를 직접 겨냥하지 않고 생성한 환경에서 학습한 정책으로 Qwen3.5-4B를 훈련한 결과, EnterpriseOps-GYM 점수는 12.3에서 15.7로, AIME26 점수는 45.9에서 56.0으로 상승했습니다. 추론, 코딩, 과학 계산, 도구 사용에서도 효과가 있었다고 요약되지만, 제공된 자료에는 전체 실험표가 없습니다.
  • 환경 생성 능력도 학습 대상. Qwen3.5-35B-A3B를 환경 구축 궤적으로 미세 조정하자 실행 가능한 세계를 작성하는 성공률이 높아졌다고 보고했습니다. 다만 개선 폭은 공개된 소재에 제시되지 않았습니다.

의미와 남은 과제

AgentMercury의 핵심 의미는 에이전트 학습 데이터의 단위를 바꾸려는 데 있습니다. 기존 합성 방식은 하나의 작업에 입력, 도구, 정답을 연결하는 경우가 많아, 데이터 양을 늘려도 각각의 연습 문제가 서로 단절되기 쉽습니다. 지속적인 세계를 단위로 삼으면 같은 업무 규칙 아래에서 여러 목표, 초기 상태, 행동 경로를 생성할 수 있습니다. 이는 장기적이고 개방적인 기업 업무의 특성에 더 가까운 학습 방식입니다.

강화학습의 피드백도 더 풍부해질 수 있습니다. 최종 답변의 정답 여부뿐 아니라 상태 전이가 유효한지, 서비스 간 제약이 유지되는지, 행동 이후 세계가 일관성을 보이는지를 평가할 수 있기 때문입니다. 이 방식이 안정적으로 확장된다면 기업용 에이전트 훈련은 문제를 순서대로 푸는 방식에서, 변화하는 업무 세계 안에서 지속적으로 행동하는 방식으로 이동할 가능성이 있습니다.

다만 현재 소재만으로는 환경 합성 과정, 품질 관리, 비교 기준, 계산 비용, 상세한 제거 실험을 확인할 수 없습니다. 도메인 외 성능 향상이 일반적인 도구 사용 능력에서 비롯됐는지도 아직 분명하지 않습니다. 따라서 AgentMercury는 실제 업무 배포를 완전히 해결한 결과라기보다, 유망한 에이전트 환경 설계 패러다임으로 보는 것이 타당합니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
Apodex 1.1, 추론을 넘어 복잡한 업무를 지속 수행하는 에이전트
AI 에이전트
cctest.ai
AI 에이전트

Apodex 1.1, 추론을 넘어 복잡한 업무를 지속 수행하는 에이전트

Apodex 1.1은 답변 생성에 그치지 않고 파일·검색·코드 환경에서 장기 작업을 수행하고 검증 가능한 결과를 내는 것을 목표로 한다. 환경 확장과 비동기 다중 에이전트 협업을 결합했으며 35B 파라미터 Mini 모델도 제공한다.

더 보기
CCTest · Blog
개별 지능에서 시스템 지능으로: LLM 에이전트에 필요한 Graph Engineering
AI 에이전트
cctest.ai
AI 에이전트

개별 지능에서 시스템 지능으로: LLM 에이전트에 필요한 Graph Engineering

서로 다른 전문성, 병렬 실행, 독립 검증, 지속적인 상태 관리가 필요한 작업에서는 단일 LLM 에이전트를 강화하는 것만으로 충분하지 않습니다. Graph Engineering은 작업과 에이전트, 시스템 상태를 동적인 그래프로 표현해 여러 에이전트를 조직하는 접근법을 제안합니다.

더 보기