아티클 목록으로
AI 에이전트

EDGEGEN, 도구 호출 에이전트를 ‘정상 경로’ 너머로 이끈다

약 4분 소요

들어가며

기업용 인공지능 에이전트는 데이터베이스 조회, 예약 변경, 권한 확인, 외부 API 호출 같은 업무를 직접 수행하고 있습니다. 하지만 도구를 호출해 그럴듯한 답변을 내놓는 것만으로는 실제 운영 환경의 요구를 충족하기 어렵습니다. 에이전트는 현재 데이터 상태와 사용자 권한, 업무 순서, 자원 충돌 여부를 함께 고려해야 합니다.

일반적인 요청, 즉 ‘happy path’에서는 성공하더라도 예약이 이미 존재하거나 계정 상태가 예외적일 때, 또는 사용자의 요구가 업무 규칙과 충돌할 때 잘못된 행동을 할 수 있습니다. Hugging Face Daily Papers에 소개된 EDGEGEN은 실제 기업 데이터와 사람의 수작업 라벨이 부족한 상황에서 이런 경계 사례를 자동으로 만드는 방법을 제안합니다.

핵심 내용

  • 준수 규칙에서 작업을 생성: EDGEGEN은 먼저 에이전트 사양에 담긴 컴플라이언스 규칙을 추출합니다. 이후 해당 규칙이 지켜지는지 확인하거나, 규칙을 위반하기 쉬운 상황을 의도적으로 만드는 작업을 생성합니다.
  • 백엔드 상태를 생성 과정에 포함: 작업을 데이터베이스와 분리된 추상적인 대화로 만들지 않고, 실제 에이전트가 사용하는 상태와 연결합니다. 같은 요청이라도 예약 정보, 계정 권한, 자원 상태에 따라 올바른 대응이 달라지는 점을 반영할 수 있습니다.
  • 모델과 하니스 모두 최적화: 생성 데이터는 모델 파인튜닝뿐 아니라 프롬프트, 도구 호출 제어, 실행 관리 등 에이전트를 둘러싼 하니스 개선에도 사용할 수 있습니다.
  • 자동화된 폐쇄 루프: 규칙 추출, 작업 생성, 에이전트 실행, 평가, 개선을 하나의 파이프라인으로 연결해 사람의 직접적인 라벨링 없이 운영하는 것을 목표로 합니다.

실험 결과가 의미하는 것

tau2bench의 항공 도메인에서 EDGEGEN 데이터로 파인튜닝한 결과, 모델과 설정에 따라 평균 진행도가 2%에서 42% 개선됐다고 논문은 보고합니다. 반면 일부 베이스라인 합성 데이터 방식은 특정 모델에서 성능 저하를 보였습니다. 이는 합성 데이터의 품질이 단순한 데이터 양보다, 대상 에이전트의 상태와 실패 유형을 얼마나 정확히 반영하는지에 달려 있음을 보여줍니다.

하니스 최적화 실험에서는 Gemma-4-e4b 모델을 대상으로 EDGEGEN 방식이 사람이 만든 하니스보다 평균 10%, 기본 하니스보다 30% 높은 개선을 보였습니다. 물론 이 수치는 논문에서 사용한 벤치마크와 설정에 한정됩니다. 그럼에도 어려운 경계 작업이 모델 자체뿐 아니라 모델 주변의 제어 계층도 개선할 수 있다는 가능성을 제시합니다.

영향과 남은 과제

EDGEGEN의 핵심 관점은 에이전트 평가의 질문을 바꾸는 데 있습니다. 평가 대상은 더 이상 “평범한 요청을 처리할 수 있는가”에 머물지 않고, “특정 상태에서도 업무 규칙을 지키는가”가 됩니다. 기업 시스템의 실제 오류는 언어 이해 부족보다 오래된 데이터, 권한 경계, 자원 충돌, 잘못된 처리 순서에서 발생하는 경우가 많습니다.

다만 현재 요약에서 제시된 결과는 주로 항공 도메인과 특정 모델 설정에 기반합니다. 다른 산업, 데이터베이스 구조, 장기적인 다단계 업무에서도 같은 효과가 재현되는지는 추가 검증이 필요합니다. 사양이 불완전하거나 모호할 때 규칙을 어떻게 추출할지, 유용한 엣지 케이스와 단지 인위적으로 어려운 작업을 어떻게 구분할지도 중요한 과제입니다.

그럼에도 EDGEGEN은 도구 호출 에이전트용 합성 데이터를 설계할 때 사용자의 요청뿐 아니라 요청이 발생한 상태와 에이전트가 따라야 할 규칙까지 포함해야 한다는 실질적인 방향을 제시합니다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
AI 연구 에이전트가 자신의 코드를 다시 쓰기 시작했다
AI 에이전트
cctest.ai
AI 에이전트

AI 연구 에이전트가 자신의 코드를 다시 쓰기 시작했다

AIDE^2는 AI 연구 에이전트가 자신의 코드 변경을 제안하고 평가한 뒤, 더 나은 버전을 다음 단계의 기반으로 삼는 순환 구조를 구현했다. 8일간의 자율 실행에서 7번의 연속 개선을 발견했으며, 그 성과는 보지 못한 과제와 분야에도 전이됐다.

더 보기
CCTest · Blog
VideoGen-Agent, 영상 생성에 도구 사용과 자기 검증을 더하다
AI 에이전트
cctest.ai
AI 에이전트

VideoGen-Agent, 영상 생성에 도구 사용과 자기 검증을 더하다

VideoGen-Agent는 영상 생성을 한 번의 프롬프트 응답이 아니라 증강·생성·검증 도구를 조율하는 다중 턴 에이전트 과정으로 바꾼다. 정체성 보존, 물리적 일관성, 다중 샷 구조를 포함한 평가에서 성능 향상을 보고했다.

더 보기
CCTest · Blog
EvoOntology: 데이터 에이전트를 위한 자기 진화형 온톨로지
AI 에이전트
cctest.ai
AI 에이전트

EvoOntology: 데이터 에이전트를 위한 자기 진화형 온톨로지

EvoOntology는 테이블, 파일, 데이터베이스를 다루는 데이터 에이전트에 실행 중 조회하고 갱신할 수 있는 온톨로지 계층을 제공합니다. MCP 서버로 구현되며 상호작용 기록을 바탕으로 의미 구조를 계속 개선합니다.

더 보기