deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak Hacker News – Front Page (native)

Bağımsız kıyaslama testi: Tabular foundation modelleri, eğitim olmadan 14 veri setinde ayarlanmış XGBoost'u geçti

Bağımsız bir RTX 4070 Ti kıyaslaması, TabPFN ve TabICL'ın test edilen on dört veri setinin tamamında, hedef tablolar üzerinde hiç eğitim yapılmadan ayarlanmış XGBoost'u geride bıraktığını ortaya koydu. Geniş tablolarda ise modeller bazında tablo daha karışık.

Bağımsız kıyaslama testi: Tabular foundation modelleri, eğitim olmadan 14 veri setinde ayarlanmış XGBoost'u geçti

Hacker News'in ana sayfasında öne çıkan, Efraín Garay tarafından yapılan bağımsız bir kıyaslama testi, aylar önce dile getirilen bir iddiayı ölçülebilir bir sınamaya tabi tuttu: tabular bir foundation modelin, hiç eğitim almadığı bir tablo üzerinde tahmin yapıp ayarlanmış gradient boosting'i yine de yenmesi. RTX 4070 Ti üzerinde yerel olarak çalıştırılan test on dört veri setini kapsıyordu — ve Garay'a göre eğitimsiz yaklaşım, tümünde hiperparametre ayarı yapılmış XGBoost'un önünde tamamladı.

Test nasıl kuruldu

Her veri seti, inria-soda tabular kıyaslama paketinden alındı; 3.000 satıra indirildi, sabit bir tohumla katmanlı olarak 70/30 bölündü. Dört yarışmacı aynı kronometreyi paylaştı; yazıda TabICL, TabPFN ve ayarlanmış XGBoost ayrıntılı biçimde ele alınıyor, ayarlanmamış XGBoost ise bir alt sınır olarak yer alıyor. On dört veri setinden sekizi tek tek listelenmiş: kredi riski, satış kampanyaları, hastaneye yeniden yatış, yeniden suç işleme skorlaması, elektrik talebi ve moleküler tarama alanlarını kapsıyor.

Tabular bir foundation model aslında ne yapar

TabPFN ve TabICL, milyonlarca amaca yönelik sentetik tablo üzerinde ön eğitimden geçmiş durumda. Yeni bir tablo geldiğinde hiçbir ağırlık güncellenmiyor: eğitim satırları — bu testlerde 2.100 satır — bağlam olarak veriliyor ve tahminler tek bir forward pass ile geri geliyor. Bu, dil modellerinden bilinen in-context learning mekanizmasının tokenlardan satır ve sütunlara taşınmış hali.

Garay, kodda tanıdık fit çağrısının hâlâ bulunduğunu ama içeride veriyi GPU'ya kopyalamaktan başka bir iş yapmadığını belirtiyor. Bu, mühendislerin alışık olduğu maliyet profilini tersine çeviriyor: fitting neredeyse bedava, hesaplama gücü ise tahmin aşamasında yoğunlaşıyor — eğitimin ağır bastığı gradient-boosted ağaçların ayna görüntüsü.

Sonuçlar, pürüzleriyle birlikte

Listelenen sekiz veri setinde TabICL yedisini kazandı, sekizincisinde berabere kaldı. Kredi riskinde TabPFN, heloc veri setinde 0.7300 skor alırken ayarlanmış XGBoost 0.7078'de kaldı; TabICL ise kredi tablosunu 0.7667'ye karşı 0.7533 aldı. Ancak iki model de alanı süpürmedi. Elektrik talebinde TabICL, ayarlanmış XGBoost ile dördüncü ondalığa kadar aynı skoru (0.8178) tuttururken TabPFN 0.8111 ile geride kaldı — bir galibiyet değil, beraberlik. Kimyasal betimleyicilerden oluşan 419 sütunlu Bioresponse tablosunda ise iki foundation model yollarını ayırdı: TabICL 0.7922 ile 0.7744'e karşı öndeydi, ama TabPFN 0.7567'ye düştü — ayarlanmamış XGBoost'un bile altına — ve bunu yapmak için 18,1 saniyeye ihtiyaç duydu. Garay'ın sonucu şu: bu modelleri zorlayan tablo uzunluğu değil, genişliği.

Doğruluk, hikâyenin bir kısmını da gizliyor. Diabetes130US yeniden yatış verisinde doğruluklar neredeyse aynıydı, ama bir triage iş akışının gerçekte dayandığı sıralama kalitesi olan AUC farkı net biçimde ortaya koydu: TabICL 0.6484'e karşı ayarlanmış XGBoost 0.6264. TabICL'ın tek geçişli tahmin süreleri dar tablolarda 0,6 ile 0,8 saniye, Bioresponse'ta ise 6,0 saniye olarak ölçüldü.

Garay, mahkemelerdeki algoritmik önyargı tartışmasının merkezindeki veri seti olan compas-two-years için kendi uyarısını ekliyor: daha iyi bir skor, yeniden suç işleme kullanım senaryosunu meşru kılmıyor, çünkü o tartışma hiçbir zaman doğruluk hakkında değildi.

Neden önemli

Standart tabular yaklaşım bir ayar döngüsü varsayar: hiperparametre ara, fit et, değerlendir, tekrarla. Ön eğitimden geçmiş bir model, küçük ve orta ölçekli tablolarda bu döngüyle yalnızca satırları kendisine verilerek eşit ya da daha iyi sonuç alabiliyorsa, hiperparametre arayışı zorunlu bir adım olmaktan çıkıp ara sıra yapılan bir iyileştirmeye dönüşüyor ve mühendislik odağı optimizer ayarlarından veri kalitesi ile değerlendirme tasarımına kayıyor.

Sınırlar, manşet kadar önemli. Bu, tek yazarlı ve tek bir tüketici GPU'da yapılmış bir kıyaslama; tablo başına 3.000 satırla sınırlı ve model bazındaki tablo geniş tablolarda — özellikle TabPFN'de — çözülüyor. Savunulabilir çıkarım, XGBoost'un modası geçtiği değil; bu boyuttaki tablolarda artık, herhangi bir ayar başlamadan önce kıyaslamada yerini hak eden ciddi bir eğitim gerektirmeyen rakibi olduğudur.

  • #machine-learning
  • #tabular-data
  • #xgboost
  • #foundation-models
  • #benchmarks

İlgili yazılar