· kaynak Hacker News – Front Page (native)
Açık kaynak Jev benzeri model metin seçeneklerini tek geçişte puanlıyor, TypeSafe'in Jev modelini yankılıyor
Bağımsız bir GitHub projesi, TypeSafe'in gizli Jev modelinin arayüzünü yeniden yaratarak, token token üretim yapmak yerine tek geçişte her metin seçeneği için bir olasılık döndürüyor.
vinnylarouge tarafından GitHub'da yayımlanan ve Hacker News ana sayfasında öne çıkan jevlike adlı proje, TypeSafe'in ticari Jev modelinin arayüzünü yeniden inşa etmeye yönelik bağımsız bir girişim. Depoya göre Jev, bir metin parçası ve N metin seçeneği listesi alıyor ve yanıtı token token üretmek yerine tek geçişte her seçenek için bir olasılık veriyor. TypeSafe, Jev'in tasarımını yayımlamadı; proje bunun yerine aynı girdi ve çıktı şekline sahip, bağımsız şekilde eğitilmiş bir başlangıç modeli sunuyor.
Mimari nasıl çalışıyor
Her seçenek, metninin kompakt sayısal bir gömmesi olan bir sorgu vektörüne dönüşüyor. Sorgu, bağlam metninin tokenları üzerinde attention ağırlıkları hesaplıyor ve bu ağırlıklar seçenek başına bir bağlam vektörü üretiyor. Paylaşılan bir dot product, her seçenek-bağlam çiftini tek bir skora dönüştürüyor ve seçenekler arasında uygulanan bir softmax, skorları bir olasılık dağılımına çeviriyor.
İki encoder yolu destekleniyor. Varsayılan yol byte gömmelerini sıfırdan öğreniyor; bu ucuz ama bağlamı 192 byte'a, her seçeneği 32 byte'a kırpiyor. İsteğe bağlı yol, uyumlu herhangi bir Hugging Face encoder'ı takıyor; encoder donmuş haldeyken yalnızca küçük bir scorer başlığı eğitiliyor; README örnek olarak Qwen/Qwen2.5-0.5B'yi veriyor. Checkpoint'ler başlığı ve encoder adını tutar, encoder ağırlıklarını değil; bu yüzden yeniden yüklemek aynı Hugging Face modeline erişim gerektirir.
Eğitim ve değerlendirme
Eğitim verisi satır başına bir JSON nesnesinden oluşuyor; bağlam, seçenek listesi ve doğru yanıtın sıfırdan başlayan indeksini içeriyor. Satırlar farklı sayıda seçenek taşıyabilir; en az iki seçenek gerekir. Komut satırı araçları sentetik veri üretir, eğitir, değerlendirir ve yeni menüleri puanlar; eğitim CPU, Apple MPS veya CUDA üzerinde çalışır.
Değerlendirme, top-1 ve top-3 doğruluğunun yanında model güvenini gözlemlenen doğrulukla karşılaştıran beklenen kalibrasyon hatasını yazdırır. Ayrıca her menüyü yanlış bağlamla eşleştiren karıştırılmış bağlam kontrolü de raporlanır; README'ye göre yararlı bir model bu taban çizgisini geçmelidir. Gerçek veri kümeleri için proje, bir müşteriye veya sayfaya ait tüm kayıtların tek bir bölme içinde tutulmasını, böylece yakın kopyaların test kümesine sızamamasını ve ayrılmış bir dosyada bir kez değerlendirme yapılmasını önerir. Bir Wikispeedia betiği, herkese açık SNAP arşivlerini indirir ve insan yol bulma üzerine Robert West ile Jure Leskovec'in WWW 2012 makalesine atıf yaparak sonraki tıklama tahmini verisi oluşturur.
Bildirilen sayılar
Projenin ardındaki deneylerde tek geçişli scorer, sentetik menülerde yaklaşık %98 doğruluğa ulaştı. Hedef olarak ayrık Wikispeedia sonraki tıklama verisinde, donmuş bir Qwen2.5-0.5B encoder'ı artı scorer %26'ya ulaştı; karıştırılmış ve rastgele encoder kontrolleri kabaca %8'de kalırken, 40.000 tıklamayla sıfırdan eğitilmiş küçük bir model %29'a ulaştı. Sekiz seçenekte tek geçiş, 400 token yazmaya zorlanan küçük bir decoder'dan kabaca 100 kat daha hızlıydı.
Depo, bu rakamların yerel deneyleri tanımladığını, hız karşılaştırmasında büyük bir ticari model yerine küçük yerel bir decoder kullanıldığını ve projenin ne Jev'in kalitesini yakaladığını ne de TypeSafe'in özel eğitim yöntemini yeniden ürettiğini açıkça belirtiyor.
Aynı başlık oyun oynuyor
Seçenek-attention başlığı, görüntü yamalarından denetleyici düğmelerini de puanlayabiliyor. On saniyelik bir tanıtım filmi iki beş saniyelik pencereyi birleştiriyor: yedi düğmeyle Doom savaşı ve beş tuş kullanan bir satranç denetleyicisi. Ortak checkpoint'ten alınan Doom penceresi, kayıtlı on bölümünde ortalama 0,60 öldürme ve -97,50 ödül aldı. Yalnızca satranç checkpoint'inden alınan satranç penceresi, rastgele oynayan bir rakibe karşı 50 örnek oyunda 4 galibiyet, 46 beraberlik ve 0 yenilgi aldı; ama Stockfish seviye 0'a karşı 0 galibiyet, 2 beraberlik ve 48 yenilgi. Depo, pencerelerin tipik oyun ya da yeterlilik iddiası olarak değil, hareketlilik için seçildiği konusunda uyarıyor. Her iki oyun da görsel scorer'ı tek bir paylaşılan modülden içe aktarıyor ve sürüm, tek oyunlu checkpoint'lerin yanında paylaşımlı bir 12 seçenekli checkpoint içeriyor.
Belirtilen sınırlamalar
Proje başka sınırlamalar da listeliyor: bu bir araştırma başlangıcı, Jev kopyası değil; doğruluk veri kalitesine, bölme kalitesine ve encoder'a bağlı; byte encoder'ı dil anlamında zayıf; ön eğitimli yol büyük bir model indirebilir ve daha çok bellek gerektirir; tek geçişli puanlama, tahminden önce seçenek listesinin eksiksiz olmasını gerektirir. Kod MIT lisanslı; indirilen veri kümeleri ve ön eğitimli modeller kendi koşullarını koruyor.
Neden önemli
Büyük dil modelleriyle yapılan işlerin çoğu otoregresif üretimden geçiyor; bu da görev bilinen bir listeden tek bir öğe seçmek olduğunda — bir destek talebini yönlendirmek, sonraki bağlantıyı seçmek veya bir menü girdisi belirlemek gibi — israf demek. Bu proje bir alternatif çerçeveliyor: her seçeneği tek geçişte doğrudan puanlayın, kalibre edilmiş olasılıkları okuyun ve gecikme ile hesaplamayı buna göre azaltın. Ayrıca ticari bir modelin arayüzünü açıkça tersine mühendislik etmenin bir vaka çalışması olarak geliştiricilere, tek geçiş paradigmasının kendi verilerinde tutup tutmadığını test etmek için çalıştırılabilir, MIT lisanslı bir temel sunuyor.
- #open-source
- #machine-learning
- #language-models
- #deep-learning