논문
TabFM: A Zero-Shot Foundation Model for Tabular Data
데이터셋마다 모델을 새로 학습할 필요 없이, 합성 데이터로 학습된 400M 파라미터 모델을 통해 즉각적인 제로샷 예측을 수행하는 정형 데이터 파운데이션 모델
논문이 다루는 내용
기존의 정형 데이터 머신러닝은 새로운 태스크마다 트리 앙상블이나 AutoML을 처음부터 실행해야 하는 번거로움이 있었습니다. 본 논문은 정형 데이터 예측을 인컨텍스트 러닝(In-context learning) 문제로 정의한 400M 파라미터 규모의 TabFM을 제안합니다. TabFM은 구조적 인과 모델(SCM) 기반의 합성 데이터로만 학습되어, 별도의 튜닝 없이도 실세계 데이터에 적용 가능한 일반적인 표현력을 학습했습니다. 실험 결과, 51개의 벤치마크 데이터셋에서 기존 AutoML 파이프라인을 능가하는 제로샷 성능을 기록했습니다. 또한, 피처 엔지니어링 자동화 및 사후 교정 기법을 결합하여 성능을 더욱 극대화했습니다.
핵심 결과
-
400M 파라미터 규모의 정형 데이터 전용 파운데이션 모델 개발
-
구조적 인과 모델 기반 합성 데이터 학습을 통한 제로샷 일반화 능력 확보
-
별도의 파인튜닝 없이 단일 포워드 패스로 수행되는 인컨텍스트 러닝 방식
실무에서 볼 만한 점
데이터가 적거나 매번 모델을 학습시키기 어려운 환경에서, 사전 학습된 모델을 즉시 배포하여 강력한 베이스라인을 확보할 수 있습니다.
읽을 때 확인할 점
-
보유 중인 소규모 정형 데이터셋에 TabFM 제로샷 성능 테스트
-
합성 데이터 기반 학습 모델이 실제 도메인 데이터의 분포를 얼마나 잘 커버하는지 검증
-
TabFM-Auto와 같은 LLM 결합형 피처 엔지니어링 워크플로우 적용 실험