deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak Hacker News – Front Page (native)

Jeff, küçük açık modelleri Jev ile uyumlu, ~30 ms'lik karar sınıflandırıcılarına dönüştürüyor

Bağımsız bir proje, Qwen3.5 ve Gemma 4'ü tüketici donanımında yaklaşık 30 ms'de seçenekleri puanlayan yalnızca karar veren mini sınıflandırıcılara dönüştürdü ve sınıflandırma karşılaştırmalarında Jev'in yayımlanan sonuçlarını hafifçe geride bıraktı.

Jeff, küçük açık modelleri Jev ile uyumlu, ~30 ms'lik karar sınıflandırıcılarına dönüştürüyor

Modeller ne yapıyor

Jeff adlı bağımsız bir proje, tek bir işi yapan üç küçük fine-tune edilmiş model yayımladı: açıklanan bir durumu ve düz dille yazılmış seçenekler listesini alıp tek bir forward pass ile her seçenek için kalibre edilmiş bir olasılık döndürmek. Projenin GitHub deposuna göre kararlar, bir NVIDIA RTX PRO 6000'de yaklaşık 22 ms, MLX çalıştıran bir Apple M4 Max'te ise 28 ms sürüyor. Modeller, yalnızca karar veren model Jev ile aynı istek formatını kabul ediyor; ancak proje, Jev'in üreticisi TypeSafe ile bir bağının veya onayının bulunmadığını açıkça belirtiyor.

Modeller ne yapıyor

Yayım, Hugging Face'te barındırılan üç checkpoint'i kapsıyor: Jeff-Qwen3.5-0.8B, Jeff-Qwen3.5-2B ve Jeff-Gemma4-E2B. Hiçbir metin üretilmiyor ve ayrıştırılması gereken bir şey yok — istek, örneğin bir müşteri iade mesajı gibi bir durumu tanımlayıp bununla ilgili sorular soruyor. Üç soru tipi destekleniyor: choice (en fazla 255 seçenekten birini seçme), noul (evet/hayır olasılığı) ve score (kullanıcı tanımlı bir ölçekte bir nokta). Tek bir istekte birkaç bağımsız soru birlikte yanıtlanabiliyor.

Sınıflandırma zero-shot olduğu için destek kuyrukları, kullanıcı niyetleri, moderasyon etiketleri veya sesli komutlar gibi kategorilerin eğitim verisinde yer alması gerekmiyor; bunlar istek anında sözle tanımlanıyor. Deponun kullanım önerisi, planlama mantığını kodda tutmak ve Jeff'i yalnızca karar verici olarak kullanmak: belirtilen seçenekler arasında seçim yapmak yerine sonuçları öngörmesi istendiğinde rastgele seçimden iyi performans göstermiyor.

Sınıflandırmada güçlü, akıl yürütmede geride

Proje, beş genel karşıtlama ölçütü genelinde 4.599 soruyu ve ayrı puanlanan JevBench'in 105 maddelik zor dilimini değerlendirdi. Jeff-Qwen3.5-2B genel olarak 83,1'e ulaştı ve Jev'in yayımladığı 83,0'ı hafifçe geçti; referans için AutoJev-27B'nin 84,9'luk sonucu gösterildi. Jeff, Financial PhraseBank'ta (96,3'e karşı 77,0) ve RAGTruth'ta (88,9'a karşı 77,3) Jev'i açık ara geçti, WinoGrande'de ise kaybetti (79,0'a karşı 90,7).

Akıl yürütme ağırlıklı setlerde fark çok açılıyor: BBH (68,0'a karşı 94,3), JudgeBench (64,6'ya karşı 78,6) ve JevBench zor dilimi (53,3'e karşı 73,3). Depo ayrıca yayımlanan Jev ve AutoJev rakamlarının aynı karşıtlama ölçütlerinin farklı bir örneklemi üzerinde ölçüldüğü uyarısını yapıyor; dolayısıyla karşılaştırmalar kontrollü değil, yol gösterici nitelikte.

Oyunlar: planlanmamış bir zero-shot testi

Karşıtlama ölçütlerinden farklı görevleri yoklamak için yazarlar, modellere oyun durumu ve geçerli hamlelerin sözle tanımlandığı Doom, Frogger ve Pac-Man oynattı; her oyunda 20 bölüm. 0.8B model, Doom'daki kill sayısında elle kodlanmış bir kural botuyla berabere kaldı (ikisi de 6,55) ve Frogger geçişlerinde neredeyse ona eşit oldu (10,3'e karşı 10,25); Pac-Man'de 98 peletin 57,0'ını topladı, bot ise 94,1 topladı. Jeff, M4 Max'te hamle başına 29–49 ms'de karar verdi; Jev'in yayımlanan Doom koşusu API çağrısı başına 212 ms sürdü, ancak proje bu iki zamanlamanın aynı donanımda ölçülmediğini belirtiyor. İlginç bir şekilde, daha yüksek karşıtlama ölçütü puanlarına rağmen daha büyük 2B model 0.8B'den daha kötü oynadı ve yazarlar hızlı seçim için en uygun model olarak 0.8B'yi öneriyor.

Evde eğitildi, yarım saatte fine-tune edilebiliyor

Her şey yerel donanımda üretildi: 0.8B, tek bir RTX PRO 6000 iş istasyonu GPU'sunda yaklaşık iki saatte, 2B ise yaklaşık 3,5 saatte eğitildi. Tüm sentetik eğitim verisi, iki DGX Spark üzerinde açık model Qwen3.8-Flash-Next tarafından yazıldı; kapalı bir model yalnızca bu verinin bir örneklemini gözden geçirmek için kullanıldı. Eğitim kodu, açık kaynaklı AutoJev reçetesi üzerine kurulu. Ağırlıklar küçük — 16-bitte 0.8B için 1,7 GB ve 2B için 4,2 GB.

Asıl pratik kazanç fine-tuning'de. Yaklaşık 11.000 uygulamaya özel örnek üzerinde yapılan bir sesli gezinme fine-tune'u, tek bir GPU'da yaklaşık yarım saat sürdü ve ayrı tutulan doğruluğu %31,7'den %95,8'e çıkardı; karar başına süre M4 Max'te yaklaşık 40 ms oldu.

Neden önemli

Jev hakkında ayrı bir dev.to denemesi ekonomik argümanı ortaya koyuyor: kurumsal agent trafiğinin çoğu düz metin üretimi değil yönlendirme, triyaj, sınıflandırma ve kapılamadan oluşuyor ve tek bir puanlama geçişi, birkaç saniyelik token üretimini saniyenin çok küçük bir kesriyle ölçülen bir hesaplamayla değiştiriyor. Jeff bu mantığı yerel tüketici donanımına taşıyor. Yaklaşık 30 ms ve 2 GB'ın altındaki ağırlıklarla yüksek hacimli yönlendirme kararları API faturalama yolundan tamamen çıkabiliyor ve gösterilen yarım saatlik fine-tune, zayıf bir zero-shot performansını üretim seviyesinde bir sınıflandırıcıya dönüştürüyor. Sınırlar da aynı derecede açık: akıl yürütme ağırlıklı işlerde küçük modeller büyük modellerin hâlâ çok gerisinde; böylece ortaya çıkan tablo bir iş bölümü — kalibre edilmiş minik karar vericiler sıcak döngüde, büyük modeller zor düşünmeye ayrılmış durumda.

  • #open-source
  • #machine-learning
  • #llm
  • #classification
  • #fine-tuning

İlgili yazılar