표 데이터용 파운데이션 모델 TabICL이 튜닝된 XGBoost를 상대로 AUC 기준 14개 데이터셋 가운데 12승 1무 1패를 기록했다는 비교 실험이 발표됐습니다. '14전 전승'이라는 통념 표지는 1승 1패의 격차와 AUC라는 단일 지표 조건을 축소한 과장 축약에 해당합니다.
원문 실험 보고에 따르면 TabICL은 14개 데이터셋에서 12승 1무 1패를 기록했으며, 무승부는 electricity에서 나왔고 패배는 albert에서 나왔습니다. 같은 실험에서 TabPFN은 11승 1무 2패로, electricity와 Bioresponse 두 데이터셋에서 XGBoost에 밀렸습니다. 두 모델이 모두 전승했다는 서술은 1차 문헌 자체의 수치와 어긋납니다.

출처: 조사 출처
보고서에 따르면 XGBoost는 정확도 기준으로 랜덤서치 25조합을 돌려 튜닝했고, 14/14라는 수치는 AUC 기준·AUC 비튜닝 부스팅 상대라는 조건이 붙는다고 명시했습니다. 평균 격차도 약 +0.011 수준으로, 원문은 압도적 우위가 아니라 일관성의 신호라고 강조했습니다. 소수점 셋째 자리의 격차를 '완승'으로 읽는 것은 근거가 없습니다.
독립 벤치마크 TabArena(NeurIPS 2025 데이터셋·벤치마크 트랙, arXiv:2506.16791)에 따르면 그래디언트 부스팅 트리는 여전히 강한 경쟁자이며, 파운데이션 모델은 더 작은 데이터셋에서 두드러진다고 평가했습니다. 이는 소규모 표 데이터에서의 우위라는 방향성 자체는 지지하지만, 조건 없는 전승 서사와는 거리를 둡니다. 방향은 부합하나 범위는 다릅니다.
419열의 Bioresponse 데이터셋에서 TabPFN은 4강 모델 가운데 최저 성적을 기록했고, 원문 스윕에서도 3,000행 상한 조건에서 500행 데이터로는 XGBoost가 이겼습니다. 고차원·대규모 데이터에서의 한계는 arXiv:2502.17361의 한계 연구와도 방향이 일치합니다. 다만 이번 결과가 구조 전환인지는 몇 분기의 관측이 더 필요합니다.
이 실험에는 분할 전 전처리가 전 모델에 동일하게 적용된 누수 가능성, TabPFN 구버전 2.2.1 사용 등 원문 스스로 인정한 제한도 있습니다. '훈련 없는 모델이 튜닝 부스팅을 능가한다'는 주장은 조건부로 대체로 사실에 해당하지만, 표지의 '14전 전승'은 부분 사실입니다.