Google TabFM, 표 형식 데이터에 제로샷 추론 적용
들어가며
표 형식 데이터 머신러닝은 알고리즘이 오래전부터 널리 사용돼 왔지만, 실제 작업 흐름은 여전히 데이터셋별로 분리돼 있다. 새로운 데이터가 들어올 때마다 범주형 변수와 결측치를 처리하고, 트리 모델이나 다른 알고리즘을 선택한 뒤, 교차 검증과 하이퍼파라미터 탐색을 반복해야 한다. Google Research의 TabFM은 이 과정을 하나의 범용 모델로 줄이려는 시도다. 모델은 표와 예측 대상의 관계를 문맥으로 받아들여 감독식 표 예측을 인컨텍스트 러닝 문제로 다룬다.
핵심 내용
- 표 형식 데이터용 파운데이션 모델: TabFM은 4억 개 파라미터를 갖고 있으며, 특정 데이터셋에 맞춘 전용 모델보다 여러 작업에 옮겨 쓸 수 있는 일반적 표현 학습을 목표로 한다.
- 제로샷 예측: 새 작업에 맞춰 모델을 미세 조정하지 않고도 한 번의 순전파에서 예측을 생성한다. 논문 초록은 예측이 보정됐다고 설명하며, 결과뿐 아니라 신뢰도도 중요하게 다룬다.
- 합성 테이블 학습: 구조적 인과 모델이 생성한 합성 테이블만 이용해 학습한다. 다양한 데이터 생성 관계를 통제해 제공할 수 있다는 장점이 있지만, 합성 분포가 특정 산업의 실제 데이터와 얼마나 가까운지는 적용 전에 검증해야 한다.
- 벤치마크 성과: TabArena의 51개 데이터셋은 분류 38개와 회귀 13개로 구성된다. 제공된 초록에 따르면 제로샷 TabFM은 기본 설정의 표 형식 파운데이션 모델 가운데 1위를 기록했고, 튜닝된 AutoML 파이프라인도 능가했다. 다만 소재에는 구체적인 점수나 성능 차이가 제시되지 않았다.
- 두 가지 확장 모델: TabFM+는 기본 가중치를 고정한 채 다중 관점 특성 확장, 앙상블, 사후 보정을 적용한다. TabFM-Auto는 LLM을 활용해 데이터셋별 전처리와 특성 공학을 지원한다. 두 방법 모두 분류와 회귀 영역에서 추가적인 성능 향상을 보였다고 보고됐다.
의미와 영향
TabFM의 핵심 가치는 파라미터 규모보다 표 형식 머신러닝의 시작점을 바꾸는 데 있다. 기존에는 데이터셋마다 모델 선택과 탐색을 새로 시작해야 했지만, 범용 모델이 즉시 초기 예측을 제공한다면 실험과 기준선 구축에 드는 시간을 줄일 수 있다. 서로 다른 표를 대량으로 처리하거나 빠르게 가능성을 확인해야 하는 팀에 특히 매력적인 방식이다.
다만 제로샷 추론이 평가의 불필요함을 뜻하지는 않는다. TabFM은 합성 데이터로 학습됐고, 공개된 성과 역시 TabArena 벤치마크를 중심으로 한다. 실제 환경에서는 시간에 따른 분포 변화, 비정상적인 결측 패턴, 데이터 누수, 개인정보 제약, 산업별 인코딩이 성능과 예측 확률의 신뢰성에 영향을 줄 수 있다. 따라서 배포 전에는 사용 환경에서 별도의 정확도와 보정 검증이 필요하다.
TabFM+와 TabFM-Auto는 범용 모델과 데이터셋별 전처리를 결합하는 현실적인 방향을 보여준다. TabFM으로 빠른 초기 결과를 얻은 뒤 자동화 도구로 도메인 적응을 수행하는 방식이다. 이것이 정교하게 튜닝된 트리 앙상블이나 AutoML을 언제나 대체할 수 있을지는 추가 검증이 필요하지만, 표 데이터 학습을 매번 처음부터 다시 만드는 작업에서 여러 과제에 걸친 추론으로 확장하려는 중요한 제안이다.
댓글
로그인 상태 확인 중…
댓글 불러오는 중…