部分属实
一项发表于arXiv的研究(arXiv:2502.05564v2)显示,无需梯度训练的表格数据模型TabPFN与TabICL,在与经过调优的XGBoost的对比中,在全部14个基准数据集上取得领先,这一结果引发了对传统梯度提升方法在表格AI领域地位的讨论。
研究对TabPFN与TabICL两种基于上下文学习(in-context learning)的表格模型进行了基准测试,对比对象为经过超参数调优的XGBoost。结果显示,这两种免训练模型在全部14个测试数据集上均优于调优后的XGBoost。
与需要在本地数据上进行多轮训练的梯度提升树不同,TabPFN和TabICL依赖预训练模型在推理时直接完成预测,无需针对具体数据集进行训练。这一特性使其在中小规模表格任务上的部署成本显著降低。
论文指出,上述结果基于其测试所用的数据集与调优条件,研究团队审阅的一手资料共3份。需要注意的是,基准结果是否适用于更大规模数据集或更广泛的实际场景,论文本身对此仍有保留,相关结论的普适性尚未完全确立。
尽管如此,XGBoost长期以来被视为表格数据任务的强力基线,此次14比0的成绩仍被视为该领域方法论转变的一个信号。
综合论文提供的数据,该说法属于部分属实。
Verdict: 部分属实