deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak Hacker News – Front Page (native)

Raschka analizi: Jev AI classifier'ı teknik camiaları neden bu kadar şaşırttı

Jev adlı yeni bir classifier modeli teknik çevrelerde olağanüstü ilgi gördü. Sebastian Raschka'nın analizi, modeli ucuz klasik classifier'lar ile genel amaçlı LLM'ler arasına yerleştiriyor.

Raschka analizi: Jev AI classifier'ı teknik camiaları neden bu kadar şaşırttı

Bir classifier olayın kahramanı oluyor

Makine öğrenmesi araştırmacısı Sebastian Raschka'ya göre, Jev adlı yeni yayınlanmış bir AI modeli, ortaya çıktığından bu yana geçen iki hafta içinde teknik camialarda alışılmadık ölçüde güçlü bir ilgi gördü. Blogunda yayınlayıp Hacker News'in ana sayfasına taşınan kapsamlı bir analizde Raschka, Jev'in ne yaptığını, perde arkasında muhtemelen nasıl çalıştığını ve classification için tasarlanmış bir modelin bu kadar ilgi uyandırmasının nedenlerini açıklamaya çalışıyor.

Araştırma sürecinde kendi değerlendirmesinin de değiştiğini açık sözlülükle itiraf ediyor: classifier'ların kendisinin kolayca taklit edebileceği tanıdık bir alan olduğu varsayımıyla yola çıkmış, modelin pratikte ne kadar iyi performans gösterdiğine şaşırarak ayrılmış. Ayrıca Jev ile herhangi bir bağı olmediğini, ücretsiz erişim almadığını da belirtiyor ve yazıyı bir destek değil teknik analiz olarak konumlandırıyor.

LLM'ler ile özel amaçlı classifier'lar arasında

Raschka, Jev'i iki uç arasına yerleştiriyor. Modern GPT sınıfı ve açık ağırlıklı büyük dil modelleri aynı classification görevlerini yerine getirebildiği gibi çok daha genel karar verme kapasitesine de sahip; ancak Jev bu görevleri daha hızlı ve daha düşük maliyetle tamamlıyor. Öteki uçta, tek bir dar ve iyi tanımlanmış problem üzerinde eğitilmiş özel amaçlı bir classifier, muhtemelen doğruluk, hız ve fiyatta Jev'i geride bırakır.

Raschka'nın anlatımıyla Jev'in vaadi genellik: herhangi tek bir problem için mümkün olan en güçlü model olmak yerine, birçok classification problemini kapsayan tek bir model. Raschka, Jev'in metodolojisiyle ilgili anlatımının resmi dokümantasyon değil eğitimli bir tahmin olduğu uyarısını yapıyor ve makale bu akıl yürütmenin yanına modelin API'sine dair bir genel bakış da ekliyor.

Makinelere metin sınıflatmanın kısa tarihi

Makalenin önemli bir bölümü, Raschka'nın Jev'i bağlamına yerleştirmek ve hype'ı kesmek için kullandığı sıkıştırılmış bir text classification tarihi. On beş yıl önce, kendisi yüksek lisans öğrencisiyken, standart yaklaşım naive Bayes, lojistik regresyon, SVM, random forest veya gradient-boosted tree gibi klasik modellere beslenen bag-of-words temsilidi. Tipik uygulamalar haber kategorizasyonundan e-posta spam filtrelemesine uzanıyordu; Raschka, Gmail'in orijinal spam filtresinin iddiaya göre bag-of-words özellikleri üzerinden naive Bayes'e dayandığını not ediyor.

Bag-of-words, değişken uzunluktaki metni, her kelimenin kaç kez geçtiğini sayarak sabit boyutlu bir vektöre dönüştürür. Hesaplama açısından ucuzdur ve belirli kelimeler bir etiket için güçlü sinyal olduğunda iyi çalışır; ama kelime sırasını tamamen görmezden gelir. Raschka'nın örneği: köpeğin insanı ısırması ile insanın köpeği ısırması gibi ters olayları anlatan iki cümle, aynı vektörlere dönüşür. N-gram özellikleri eklemek, çok daha büyük bir kelime dağarcığı bedeliyle yerel kelime sırasını kısmen geri kazanır. Buna rağmen Raschka, uygulaması çok kolay olduğundan, herhangi bir text classification projesi için bag-of-words artı lojistik regresyonu hâlâ baseline olarak öneriyor.

Zaman çizelgesinde bir sonraki aşama word embedding'ler: Word2Vec ve GloVe gibi yöntemlerle üretilen ya da ağın içinde öğrenilen, kelimeleri temsil eden yoğun öğrenilmiş vektörler. Embedding'ler, CNN ve RNN mimarilerinin metni yapıyı koruyarak işleyebilmesini sağladı. Ama bu klasik embedding'ler arama anında bağlamdan bağımsızdır; yani "bank" gibi bir kelime, "nehir" kelimesinin yanında da finansla ilgili bir cümlede de aynı vektörü alır. Bu sınırlılığın olduğu noktada transformer çağı modelleri ve nihayetinde Jev gibi modeller devreye giriyor.

Neden önemli

Jev'in gördüğü ilgi, AI yığınının ilginç katmanının her zaman en büyük model olmadığını gösteriyor. Özel bir classifier tek görevde kazanıyorsa ve LLM genellikte kazanıyorsa, Jev'in bahsi, gerçek iş yüklerinin çoğunun bu kutuplar arasında olduğu ve birçok problemde biraz zirve doğruluktan vazgeçip daha ucuz, daha hızlı classification'a razı olacağı yönünde. Raschka'nın çerçevesi mühendislik ekiplerine pratik bir karar kuralı veriyor: problem sabit ve darsa özel amaçlı bir classifier, genel akıl yürütme gerekiyorsa bir LLM, maliyet ve gecikme ölçekte önem taşıyan geniş orta alanda ise genel amaçlı bir classifier kullanın. Tarihsel turu aynı zamanda hype'a bir düzeltme işlevi görüyor. Jev özünde bir text classifier; ama konumlandırması ve ekonomisi onu sıradan bir classifier olmaktan öteye taşıyor.

  • #ai
  • #machine-learning
  • #text-classification
  • #language-models
  • #llm

İlgili yazılar