TabFM-Auto: Self-Evolving Pipelines for Tabular Foundation Models
LLM 에이전트가 데이터 메타데이터를 활용해 정형 데이터 파이프라인을 스스로 진화시키는 Tabular Foundation Model 최적화 프레임워크
논문이 다루는 내용
기존의 정형 데이터 파운데이션 모델은 합성 데이터로 사전 학습되어 강력한 제로샷 성능을 보이지만, 컬럼명이나 태스크 설명 같은 데이터의 의미적 맥락을 충분히 활용하지 못하는 한계가 있습니다. 또한 기존의 자동화된 ML(AutoML) 방식은 매번 모델을 처음부터 학습하므로 노이즈가 많고 과적합 위험이 큽니다. 본 논문은 TabFM 모델과 LLM 에이전트를 결합하여 데이터 파이프라인을 반복적으로 개선하는 TabFM-Auto를 제안합니다. 에이전트는 데이터 메타데이터와 검증 피드백을 바탕으로 데이터 정제, 피처 엔지니어링, 컨텍스트 선택 등을 스스로 수행하며 모델의 에러를 줄여나갑니다. 실험 결과, TabFM-Auto는 TabArena 벤치마크에서 최상위 성능을 기록했으며, 발견된 파이프라인은 다른 고정된 모델로도 성공적으로 전이되었습니다.
핵심 결과
-
LLM 에이전트를 활용한 데이터 정제, 피처 엔지니어링, 후처리 파이프라인의 자동 진화
-
데이터 메타데이터(컬럼명, 태스크 설명 등)를 활용하여 파운데이션 모델의 의미적 이해도 극대화
-
학습된 파이프라인이 다른 고정된(frozen) 정형 데이터 모델로도 높은 성능 전이 효과를 보임
실무에서 볼 만한 점
모델 구조를 건드리지 않고도 데이터 전처리 및 피처 엔지니어링만으로 파운데이션 모델의 성능을 극대화하는 새로운 워크플로를 제시합니다.
읽을 때 확인할 점
-
보유 중인 정형 데이터셋에 LLM 기반 피처 엔지니어링 에이전트 적용 테스트
-
TabFM과 같은 사전 학습된 정형 데이터 모델과 LLM 에이전트 결합 구조 설계
-
메타데이터(컬럼명 등)가 모델 성능에 미치는 영향도 분석 실험