· kaynak Hacker News – Front Page (native)
Kev, yerel agent çağrıları için kendi kendine eğitilebilen Qwen3.5 karar modellerini yayınladı
jaredpalmer tarafından GitHub'da yayınlanan Kev, Qwen3.5 üzerine kurulu, 0.8B'den 9B'ye kadar karar modelleri sunuyor; evet/hayır, çoktan seçmeli ve puanlama sorularını TypeSafe'in System One ile uyumlu bir API üzerinden yerel olarak yanıtlıyor.
Yapılandırılmış kararlar için küçük modeller
jaredpalmer adıyla GitHub'da yayınlanan ve Hacker News'in ana sayfasında öne çıkan Kev projesi, Qwen3.5 temel modelleri üzerine inşa edilmiş kompakt karar modellerinden oluşan bir aile. Kev, düz metin üretmek yerine girdi metni hakkında yapılandırılmış soruları yanıtlıyor: evet/hayır değerlendirmeleri, çoktan seçmeli tercihler ve puanlamalar. Depoya göre tasarım, "Jev's Architecture Unmasked" adlı yazıda açıklanan mimariyi izliyor ve proje hem ön eğitilmiş ağırlıkları hem de kendi varyantlarınızı oluşturmak için gereken eğitim kodunu içeriyor.
Mevcut nesil üç boyutta geliyor — 0.8B, 4B ve 9B parametre — ve tümü aynı eğitim verisi ve ayarlarla Qwen3.5-Base kontrol noktalarından ince ayarlanmış. README'deki öneri, Kev-4B ile başlamak, doğruluk ve kalibrasyon bellekten daha önemli olduğunda Kev-9B'ye geçmek ve ayak izi öncelikli olduğunda Kev-0.8B kullanmak.
Sorular, olasılıklar ve System One API'si
Sunucu, bir durum metni artı bir dizi soru alan tek bir endpoint ortaya koyuyor: POST /v1/systemone. Üç soru tipi destekleniyor: "noul" evet olasılığını döndürüyor; "choice" 1'den 255'e kadar adlandırılmış seçenek arasından seçim yapıyor ve her seçeneğin isteğe bağlı bir açıklaması var; "score" girdiyi 2'den 255'e kadar sıralı düzeye eşliyor ve bir açıklamayla birlikte ortalama düzey indeksini döndürüyor. Tek bir istekte birden fazla soru gönderilebiliyor — sorular girdi metnini paylaşıyor ama birbirlerinin yanıtlarını göremiyor; proje bu özelliği o kadar önemli buluyor ki playground'u soru izolasyonunu test etmek için hazır ayarlar içeriyor.
Yanıtlar çıplak etiketler yerine olasılık dağılımları ve güven değerleri içeriyor. README'deki örnek senaryoda — geç kalan, yanlış beden olan ayakkabılar ve mükerrer bir tahsilat içeren bir destek talebi — yönlendirme sorusu olasılıklarını iade (0.47), kargo (0.28) ve faturalama (0.25) arasında dağıtıyor; zaten bir talep birden fazla departmanı ilgilendirdiğinde dağılım almanın anlamı da bu. Proje, güven değerlerinin kamuya açık olmayan bir TypeSafe formülünü yaklaşıklıkla yansıttığını ve ölçülmüş doğruluk oranları olmadığını belirtiyor.
API bilinçli olarak TypeSafe'in System One'ıyla eşleşiyor, böylece TypeSafe'in Python SDK'sı başka bir değişiklik yapılmadan yerel bir Kev sunucusuna yönlendirilebiliyor.
Benchmark'lar nasıl görünüyor
Her model için geliştirme ve test ayrımlarında sonuçlar raporlanıyor; bunlar ayrıca "eğitilmiş kaynaklar" (eğitim veri kümelerinden ayrılmış örnekler) ve "yeni kaynaklar" (modellerin hiç görmediği veri kümeleri ve kural tipleri) olarak ikiye ayrılıyor. Yeni kaynaklarda Kev-9B, 0.291 / 0.243 Brier skorlarıyla 0.812 geliştirme / 0.837 test doğruluğu elde ediyor; Kev-4B 0.794 / 0.832'ye ulaşıyor; Kev-0.8B 0.643 / 0.668 başarıyor.
Barındırılan Jev modeliyle karşılaştırma daha olumsuz: Jev, yeni kaynak geliştirme setinde 0.857 doğruluk ve 0.211 Brier skoruyor ve Kev-9B yaklaşık 4.5 puan geride kalıyor. README, Jev'in eğitim verisi bilinmediği için bunun kontrollü bir karşılaştırma olmadığını açıkça belirtiyor.
Nesiller arasında daha temiz bir deney var. Önceki Kev ailesi aynı veri ve ayarlarla Qwen3 temelleri kullanıyordu, dolayısıyla yalnızca temel model değişti. Test setinde Kev-9B, Qwen3-8B öncülünden 7.3 puan önde (%95 güven aralığı +2.8 ile +11.7) ve Brier skoru 0.08 daha düşük; Kev-4B 2.9 puan önde (−0.9 ile +6.4) ve Kev-0.8B 4.8 puan önde (+0.2 ile +9.3). Qwen3 ağırlıkları yayında kalmaya devam ediyor ve bir Mac'te daha hızlı seçenek, ancak artık geliştirilmiyorlar.
Kendiniz çalıştırma ve eğitme
Kurulum Python 3.12+ ve uv gerektiriyor; hızlı başlangıç Kev-4B'yi yerel olarak sunuyor ve ilk çalıştırmada adapter ile temel modeli indiriyor. Hem CUDA hem Apple Silicon destekleniyor ve README, 4B ve 9B modellerin bf16 ile 32 GB'lık bir Mac'e sığdığını söylüyor. Örnek yanıt, Apple M5 üzerinde bf16 ile Kev-4B için 495 ms gecikme bildiriyor. Node tabanlı bir playground, kullanıcıların soruları birlikte paketleyerek mi ayrı ayrı mı sorulduğunu karşılaştırmasına, bir seçim sorusunu altı farklı seçenek sıralamasıyla çalıştırmasına, soru izolasyonunu ve sahte ayraç token'larını yoklamasına ve modele karşı satranç oynamasına olanak tanıyor; yasal hamleler seçim seçenekleri ve bir puanlama sorusu konumu değerlendiriyor.
Ağırlıklar, tarball'lar ve SHA-256 sağlama toplamları içeren bir model koleksiyonu ve bir GitHub release üzerinden dağıtılıyor; depo eğitim kodunu ve değerlendirme verisini içeriyor. Girdi tarafında, kullanıcı metnindeki ayraç benzeri dizgiler tokenizasyon öncesi escape ediliyor ve geçersiz istekler 422 döndürüyor.
Neden önemli
Agent pipeline'ları rutin olarak aslında sınıflandırma olan çağrılar için büyük bir üretken model harcıyor: talepleri yönlendirme, tırmandırma işaretleme, aciliyet puanlama. Kev'in iddiası, bu kararların kalibre edilmiş olasılık dağılımları döndüren küçük, yerel olarak barındırılan, ince ayarlanabilir bir model tarafından ele alınabileceği — çalıştırması daha ucuz, denetlemesi daha kolay ve özel altyapıda tutulabilir olduğu. Benchmark yaklaşımı, hangi karşılaştırmaların kontrollü hangilerinin olmadığı konusunda alışılmadık derecede açık sözlü. Barındırılan Jev'e karşı yaklaşık 4.5 puanlık fark, kendi kendine barındırılan açık modellerin henüz eşitlikte olmadığını gösteriyor; ancak Qwen3'ten Qwen3.5'e geçiş sonucu, temel model iyileştirmelerinin aşağı doğru karar kalitesine aktığını kanıtlıyor. System One API'sine karşı zaten geliştirme yapan ekipler için Kev, yerinde takılan bir yerel backend olarak çalışıyor.
- #open-source
- #machine-learning
- #ai-agents
- #qwen
- #local-models