Đúng một phần
Một nghiên cứu đăng trên arXiv so sánh các mô hình học máy cho dữ liệu dạng bảng cho thấy TabPFN và TabICL — những mô hình không cần huấn luyện theo nghĩa truyền thống — đã vượt qua XGBoost sau khi được tinh chỉnh siêu tham số trong cả 14 trên 14 bộ dữ liệu được xét.
Theo nghiên cứu, TabPFN và TabICL thuộc hướng tiếp cận dựa trên suy luận trực tiếp (in-context), cho phép dự đoán trên dữ liệu mới mà không cần quy trình huấn luyện lặp như các mô hình gradient boosting. Khi đối chiếu với XGBoost đã được tinh chỉnh kỹ, hai mô hình này đạt kết quả tốt hơn trên toàn bộ 14 bộ dữ liệu trong phạm vi đánh giá.
Kết quả 14/14 áp dụng cho tập bộ dữ liệu và điều kiện thí nghiệm cụ thể được nêu trong nghiên cứu; tài liệu không khẳng định kết quả này mở rộng cho mọi loại dữ liệu bảng hoặc mọi cấu hình XGBoost. Việc mô hình boosting vẫn giữ vai trò gì trong các tình huống quy mô lớn hoặc đặc thù khác chưa được xác lập trong phạm vi tài liệu này.
Nếu kết quả được cộng đồng nghiên cứu tái lập rộng rãi hơn, các mô hình kiểu TabPFN và TabICL có thể trở thành lựa chọn mặc định cho bài toán dữ liệu bảng vừa và nhỏ, giảm chi phí tinh chỉnh siêu tham số — công đoạn thường tốn nhiều thời gian khi dùng XGBoost và các mô hình boosting tương tự.
Với những gì nghiên cứu thể hiện trên 14/14 bộ dữ liệu, kết luận phù hợp nhất là: Đúng một phần
Verdict: Đúng một phần