아티클 목록으로
모델 평가

Argo-Bench, 기업 규모 업무 흐름에서 데이터 에이전트 평가

약 3분 소요

들어가며

기업의 데이터 업무는 자연어를 SQL로 바꾸는 데서 끝나지 않는다. 여러 데이터 영역에 흩어진 정보를 찾고, 업무에 필요한 사실을 재구성하고, 통계 분석을 수행한 뒤 실제 조치를 결정해야 한다. Argo-Bench는 이러한 전체 과정을 평가하기 위해 설계된 데이터 에이전트 벤치마크다.

Text-to-SQL을 넘어선 평가

기존 text-to-SQL 벤치마크는 자연어 요청을 실행 가능한 쿼리로 변환하는 능력을 중심으로 측정해 왔다. 그러나 기업 데이터 웨어하우스에서는 필요한 정보가 수많은 테이블에 나뉘어 있고, 올바른 쿼리 하나만으로는 좋은 의사결정을 보장할 수 없다. 지표의 의미를 잘못 이해하거나 핵심 테이블을 빠뜨리면 결과가 틀릴 수 있으며, 일부 기존 벤치마크는 정답 자체에 오류가 있다는 감사 결과도 있었다.

Argo-Bench는 공개 데이터, 동료 심사를 거친 산업 연구, 규제기관 제출 자료를 바탕으로 뉴욕시 음식 배달 플랫폼을 시뮬레이션한다. 2024년 주문 8,100만 건을 가정하고, Oracle E-Business Suite를 참고한 ERP형 웨어하우스에 235개 테이블과 75억 개 행을 구성했다. 경제적 관계, 사기 패턴, 마켓플레이스 인센티브도 환경에 포함된다.

에이전트가 보는 웨어하우스에는 시뮬레이터의 실제 정답 상태가 그대로 노출되지 않는다. 에이전트는 테이블을 탐색하며 필요한 사실을 복원한 다음, 그 결과를 바탕으로 조치를 제출해야 한다. 사기 계정 차단, 배달원 인센티브 예산 배분, 미지급 임금 지급 등이 예시다. 채점은 SQL 문법이나 형식이 아니라 시뮬레이션에서 해당 조치가 만들어낸 결과를 기준으로 이뤄진다.

핵심 포인트

  • 데이터 탐색, 통계 분석, 예측, 사기 방지 등 기업 분석 업무를 평가한다.
  • 대규모 스키마에서 관련 테이블과 컬럼을 찾아 사실을 재구성해야 한다.
  • 쿼리 정확도보다 최종 행동의 결과를 중심으로 점수를 매긴다.
  • 모든 과제에 웨어하우스만으로 해결 가능함을 보여주는 실행 가능한 참고 해법이 있다.
  • 14개 프런티어 및 오픈 웨이트 모델 가운데 최고 모델이 95점 이상을 받은 과제는 34.8%뿐이었다.

의미와 영향

Argo-Bench는 ‘데이터를 조회하는 능력’과 ‘신뢰할 수 있는 업무 결정을 내리는 능력’ 사이의 간극을 드러낸다. 모델이 실행 가능한 SQL을 만들더라도 중요한 표를 놓치거나, 업무 정의를 오해하거나, 조치의 부작용을 검토하지 않을 수 있다. 최종 행동 이후의 결과를 평가하면 기업이 실제로 중시하는 손실 감소, 자원 배분, 보상 처리의 적절성을 더 직접적으로 확인할 수 있다.

앞으로 데이터 에이전트에는 SQL 생성 능력뿐 아니라 스키마 이해, 통계적 추론, 계획 수립, 결과 검증, 사업적 영향에 대한 판단이 필요하다. 시뮬레이션이 모든 산업과 실제 데이터 품질을 완전히 재현할 수는 없지만, 증거 수집에서 행동까지의 폐쇄형 업무 흐름을 통제된 환경에서 시험한다는 점에서 의미가 있다. 공개된 결과는 기업 데이터에서 안정적으로 행동하는 일이 그럴듯한 SQL을 생성하는 것보다 훨씬 어렵다는 점을 보여준다.

출처: Hugging Face Daily Papers

댓글

로그인 상태 확인 중…

댓글 불러오는 중…

관련 게시물

CCTest · Blog
OpenTumorBoard, 암 다학제 진료에서 AI의 협업 추론을 시험하다
모델 평가
cctest.ai
모델 평가

OpenTumorBoard, 암 다학제 진료에서 AI의 협업 추론을 시험하다

OpenTumorBoard는 공개된 종양 다학제 회의 기록을 활용해 전문의 답변과 전체 회의 시뮬레이션을 평가하는 벤치마크입니다. 최신 모델도 전문가의 답변과 실제 위원회 결론을 일관되게 재현하는 데는 상당한 한계를 보였습니다.

더 보기
CCTest · Blog
PhysVista, 인식·추론·평가 루프로 VLM의 물리 지능을 검증
모델 평가
cctest.ai
모델 평가

PhysVista, 인식·추론·평가 루프로 VLM의 물리 지능을 검증

PhysVista는 비전-언어 모델이 영상의 표면적 내용을 인식하는 데 그치지 않고 물리적 일관성을 이해하는지 평가하는 벤치마크입니다. 실제 영상과 AI 생성 영상을 대상으로 물리 상태 인식, 동역학 추론, 물리적 개연성 판단을 하나의 루프로 검증합니다.

더 보기