EDGEGEN, 도구 호출 에이전트를 ‘정상 경로’ 너머로 이끈다
들어가며
기업용 인공지능 에이전트는 데이터베이스 조회, 예약 변경, 권한 확인, 외부 API 호출 같은 업무를 직접 수행하고 있습니다. 하지만 도구를 호출해 그럴듯한 답변을 내놓는 것만으로는 실제 운영 환경의 요구를 충족하기 어렵습니다. 에이전트는 현재 데이터 상태와 사용자 권한, 업무 순서, 자원 충돌 여부를 함께 고려해야 합니다.
일반적인 요청, 즉 ‘happy path’에서는 성공하더라도 예약이 이미 존재하거나 계정 상태가 예외적일 때, 또는 사용자의 요구가 업무 규칙과 충돌할 때 잘못된 행동을 할 수 있습니다. Hugging Face Daily Papers에 소개된 EDGEGEN은 실제 기업 데이터와 사람의 수작업 라벨이 부족한 상황에서 이런 경계 사례를 자동으로 만드는 방법을 제안합니다.
핵심 내용
- 준수 규칙에서 작업을 생성: EDGEGEN은 먼저 에이전트 사양에 담긴 컴플라이언스 규칙을 추출합니다. 이후 해당 규칙이 지켜지는지 확인하거나, 규칙을 위반하기 쉬운 상황을 의도적으로 만드는 작업을 생성합니다.
- 백엔드 상태를 생성 과정에 포함: 작업을 데이터베이스와 분리된 추상적인 대화로 만들지 않고, 실제 에이전트가 사용하는 상태와 연결합니다. 같은 요청이라도 예약 정보, 계정 권한, 자원 상태에 따라 올바른 대응이 달라지는 점을 반영할 수 있습니다.
- 모델과 하니스 모두 최적화: 생성 데이터는 모델 파인튜닝뿐 아니라 프롬프트, 도구 호출 제어, 실행 관리 등 에이전트를 둘러싼 하니스 개선에도 사용할 수 있습니다.
- 자동화된 폐쇄 루프: 규칙 추출, 작업 생성, 에이전트 실행, 평가, 개선을 하나의 파이프라인으로 연결해 사람의 직접적인 라벨링 없이 운영하는 것을 목표로 합니다.
실험 결과가 의미하는 것
tau2bench의 항공 도메인에서 EDGEGEN 데이터로 파인튜닝한 결과, 모델과 설정에 따라 평균 진행도가 2%에서 42% 개선됐다고 논문은 보고합니다. 반면 일부 베이스라인 합성 데이터 방식은 특정 모델에서 성능 저하를 보였습니다. 이는 합성 데이터의 품질이 단순한 데이터 양보다, 대상 에이전트의 상태와 실패 유형을 얼마나 정확히 반영하는지에 달려 있음을 보여줍니다.
하니스 최적화 실험에서는 Gemma-4-e4b 모델을 대상으로 EDGEGEN 방식이 사람이 만든 하니스보다 평균 10%, 기본 하니스보다 30% 높은 개선을 보였습니다. 물론 이 수치는 논문에서 사용한 벤치마크와 설정에 한정됩니다. 그럼에도 어려운 경계 작업이 모델 자체뿐 아니라 모델 주변의 제어 계층도 개선할 수 있다는 가능성을 제시합니다.
영향과 남은 과제
EDGEGEN의 핵심 관점은 에이전트 평가의 질문을 바꾸는 데 있습니다. 평가 대상은 더 이상 “평범한 요청을 처리할 수 있는가”에 머물지 않고, “특정 상태에서도 업무 규칙을 지키는가”가 됩니다. 기업 시스템의 실제 오류는 언어 이해 부족보다 오래된 데이터, 권한 경계, 자원 충돌, 잘못된 처리 순서에서 발생하는 경우가 많습니다.
다만 현재 요약에서 제시된 결과는 주로 항공 도메인과 특정 모델 설정에 기반합니다. 다른 산업, 데이터베이스 구조, 장기적인 다단계 업무에서도 같은 효과가 재현되는지는 추가 검증이 필요합니다. 사양이 불완전하거나 모호할 때 규칙을 어떻게 추출할지, 유용한 엣지 케이스와 단지 인위적으로 어려운 작업을 어떻게 구분할지도 중요한 과제입니다.
그럼에도 EDGEGEN은 도구 호출 에이전트용 합성 데이터를 설계할 때 사용자의 요청뿐 아니라 요청이 발생한 상태와 에이전트가 따라야 할 규칙까지 포함해야 한다는 실질적인 방향을 제시합니다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…