BI-Agent와 BI-Bench가 제시한 엔드투엔드 비즈니스 인텔리전스 자동화
들어가며
Power BI나 Tableau 같은 BI 도구는 사용자가 질문을 입력하면 곧바로 차트나 수치를 보여주는 것처럼 보입니다. 그러나 실제 답변을 만들기 위해서는 관련 테이블을 찾고, 필드와 값을 변환하며, 테이블 사이의 관계를 설정해야 합니다. 이 중 한 단계라도 잘못되면 최종 분석 결과의 신뢰성이 떨어집니다.
논문 BI-Agent and BI-Bench: Towards Automating End-to-End Business Intelligence는 대규모 언어 모델이 사용자의 수작업 없이 이 전체 과정을 처리할 수 있는지 살펴봅니다.
핵심 내용
- 실제 BI 자료를 활용한 벤치마크. 연구진은 공개된 BI 프로젝트를 수집하고 실제 사용자 대시보드에서 질문과 정답 쌍을 직접 추출했습니다. 이를 바탕으로 엔드투엔드 BI 능력을 평가하는 BI-Bench를 만들었습니다.
- 범용 모델의 성능은 아직 낮다. 논문에 따르면 최첨단 LLM도 BI-Bench에서 50% 미만의 정확도를 기록했습니다. 데이터 관련 일반 추론 능력만으로는 복잡한 기업 분석 흐름을 안정적으로 처리하기 어렵다는 의미입니다.
- BI-Agent는 작업을 세분화한다. 시스템은 문제를 검색, 조인, 변환과 같은 구조화 데이터 하위 작업으로 나누고, 각 단계에서 특화된 데이터 관리 방법을 조합합니다.
- 실제 프로젝트에서 학습 궤적을 만든다. 연구진은 BI 프로젝트에서 학습 궤적을 합성한 뒤 지도 미세조정과 강화학습을 함께 적용해 에이전트를 후학습했습니다.
- 도구 사용과 후학습이 서로 보완된다. 논문은 도구 증강 방식이 모델을 그대로 사용하는 경우보다 최대 40%포인트의 정확도 향상을 보였다고 보고합니다. 후학습된 BI-Agent의 경우에는 최대 30%포인트의 향상이 보고됐습니다. 실제 수치는 모델과 실험 조건에 따라 달라집니다.
의미와 영향
이 연구의 핵심은 기업용 AI의 병목이 단순히 SQL을 생성할 수 있는지에 있지 않다는 점입니다. 더 어려운 문제는 데이터 자산의 구조를 이해하고, 자연어로 표현된 업무 질문을 테이블 선택, 변환, 조인, 지표 정의로 연결하는 것입니다. 따라서 실용적인 BI 어시스턴트는 한 번의 답변을 생성하는 모델이 아니라 여러 단계를 조정하는 워크플로 시스템에 가까워야 합니다.
BI-Bench는 단일 코드 생성이나 질의 응답이 아니라 질문에서 답변에 이르는 전체 과정을 평가하려 한다는 점에서 의미가 있습니다. 다만 벤치마크 점수가 높아졌다고 해서 기업 분석을 곧바로 무인화할 수 있는 것은 아닙니다. 데이터 접근 권한, 서로 다른 지표 정의, 결측치와 이상치, 결과 감사는 실제 배포에서 해결해야 할 과제입니다.
앞으로 BI 에이전트의 경쟁력은 모델 규모만으로 결정되지 않을 가능성이 큽니다. 도구 오케스트레이션, 도메인 특화 후학습, 처리 과정의 설명 가능성, 기업 데이터 거버넌스와의 결합이 함께 중요해질 것입니다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…