deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak dev.to (home feed)

Eğitimsiz TabPFN ve TabICL, ayarlanmış XGBoost'u 14 benchmark tablosunun tamamında yendi

Bir dev.to benchmark'ı, in-context tablo modelleri TabPFN ve TabICL'yi ayarlanmış XGBoost ile 14 Grinsztajn veri setinde karşılaştırdı ve eğitim atlayan modeller her tabloyu kazandı.

Eğitimsiz TabPFN ve TabICL, ayarlanmış XGBoost'u 14 benchmark tablosunun tamamında yendi

Benchmark ne buldu

Efrain Garay tarafından hazırlanıp dev.to'da yayımlanan bir uygulayıcı benchmark'ı, iki in-context tablo modeli olan TabPFN ve TabICL'yi, Grinsztajn benchmark'ından alınan 14 veri seti üzerinde ayarlanmış bir XGBoost kurulumuna karşı yarıştırdı; Grinsztajn, küçük ve orta ölçekli tablo sınıflandırma ile regresyon görevlerinden oluşan, yaygın kullanılan bir derlemdir. Garay'a göre, bu tablolarda hiç eğitilmemiş modeller 14 tablonun 14'ünü de kazandı.

Skordan daha önemli olan, arkasındaki mekanizma. TabPFN ve TabICL, uyarlama (fitting) adımını tamamen atlayan tablo temel modeli ailesine ait: başka yerlerde önceden eğitilmişlerdir ve yeni bir veri seti için tahmin üretirken onda gradient descent çalıştırmak yerine girdi olarak okurlar. Buna karşılık XGBoost bu karşılaştırma için özenle ayarlanmış olmasına rağmen tüm tablolarda kaybetti.

Karşılaştırma nasıl kuruldu

Garay, her yöntemin aynı veri bölünmeleri ve aynı ölçüm koşulları altında değerlendirildiğini yazıyor. 14 veri seti, ağaç tabanlı modellerin tipik tablo verisinde hâlâ derin öğrenmeyi neden yendiğini inceleyen 2022 tarihli bir çalışmayla tanıtılan Grinsztajn derlemesinden geliyor. Bu da mecrayı anlamlı kılıyor: boosting'in sıradan tablolardaki egemenliğini kanıtlamak için kurulan benchmark, tam da eğitimsiz modellerin süpürdüğü yer oldu. Veri seti başına sonuçlar ve kaynak maliyetleri de dahil olmak üzere tüm ölçümler, yazarın blogundaki daha uzun bir yazıda yer alıyor.

Eğitimsiz tahmin burada ne anlama geliyor

TabPFN, önceden uyarlanmış bir ağ (prior-fitted network): büyük bir sentetik veri seti külliyatı üzerinde önceden eğitilmiş bir transformer. Yeni bir tablo verildiğinde eğitim satırlarını bağlam (context) olarak ele alır ve tahminleri doğrudan üretir; ne epoch vardır, ne veri setine özel gradient, ne de uygulamalı tablo çalışmalarına hâkim olan yoğun hyperparameter aramasının büyük kısmı. TabPFN v2, 2025 başında bir Nature makalesinde tanımlandı ve küçük veri setlerinde ayarlanmış baseline'ları yendiğini bildirdi. 2025'te Google öncülüğündeki bir araştırma ekibi tarafından tanıtılan TabICL ise aynı fikri daha büyük ve daha çeşitli bir ön eğitim külliyatıyla genişletiyor; hedefi daha büyük tablolar ve sınıflandırmanın yanı sıra regresyon.

Pratik sonuç, yalnızca doğruluk değil, iş akışında bir değişiklik: güçlü bir tablo tahmincisi, bir training pipeline'a sahip olmaktan çok bir modeli çağırmaya yakın biçimde, checkpoint'ten yüklediğiniz bir şeye dönüşüyor.

Boosting'in avantajını koruduğu yer

Garay'nın yazısı ayrıca eğitimsiz yaklaşımın gecikme (latency) ve VRAM maliyetini — yani in-context tahminin bir eğitim bütçesi yerine harcadığı kaynakları — raporluyor ve hangi durumlarda hâlâ boosting'e başvuracağını anlatıyor. Bu modeller tahmin anında eğitim tablosunu bağlam olarak okuduğundan, hesaplama ve bellek kullanımları eğitimde bir kez ödenmek yerine tabloyla birlikte ölçekleniyor. Bu da doğal kırılma çizgisini gösteriyor: süpürmenin gerçekleştiği küçük ve orta tablolar temel modellerin lehineyken, çok büyük tablolar ve sıkı gecikme gerektiren sunum boosting'in bölgesi olmaya devam ediyor. Kesin gecikme ve bellek rakamları dev.to özetinde değil, yazarın tam yazısında yer alıyor.

Neden önemli

Gradient-boosted ağaçlar yaklaşık on yıldır tablo verisi için varsayılan cevaptı ve bir XGBoost'u ayarlamak çoğu uygulamalı makine öğrenmesinde refleks halindeki ilk hamledir. Önceden eğitilmiş bir model, hiçbir ayar döngüsü olmadan görülmemiş bir tabloya yerleştirilip standart bir benchmark dermesindeki her veri setinde bu refleksi yenebiliyorsa, makul baseline değişir: önce temel modeli deneyin, boosting'i kötü kaldığı durumlara saklayın. Tek bir uygulayıcının yürüttüğü 14 veri setlik bir karşılaştırma sorunu kesin olarak çözmez ve hem kaynak maliyetleri hem de tek yazarlı yöntembilim incelemeyi hak eder; ancak sonuç, bu modellere ilişkin hakemli literatürle aynı yönü gösteriyor: tablo temel modelleri merak konusundan güvenilir varsayılana doğru ilerliyor.

  • #tabular-data
  • #machine-learning
  • #xgboost
  • #tabpfn
  • #benchmark

İlgili yazılar