deniz.in

Piyasalar

Hava durumu

Hava durumu yükleniyor

· kaynak Hacker News – Front Page (hnrss.org)

Privatemode, GLM-5.3-Flash'ı seçenek başına olasılık üreten tek geçişli bir karar modeline dönüştürüyor

Bir Privatemode yazısı, vLLM üzerinde çalışan GLM-5.3-Flash'ın tek bir forward pass ile her seçenek için olasılık içeren tipli seçimler döndürdüğünü gösteriyor; model, fine-tuning olmadan Jev'in doğruluk ve hızına ulaşıyor.

Privatemode, GLM-5.3-Flash'ı seçenek başına olasılık üreten tek geçişli bir karar modeline dönüştürüyor

Şu anda Hacker News'in ön sayfasında yer alan bir Privatemode blog yazısı, değiştirilmemiş bir LLM'in hızlı bir karar motoru olarak işlev görebildiğini gösteriyor: verilen bir durum ve sabit bir seçenek kümesi karşılığında, model her seçenek için bir olasılıkla birlikte tek bir tercih döndürüyor — tüm bunlar tek bir forward pass ile, hiç fine-tuning yapmadan. 24 Eylül 2026 tarihli yazıda yazar Marko Rosenmüller ve ekibi, teknik vLLM üzerinde sunulan GLM-5.3-Flash ile değerlendirmiş ve sonuçların, amaca özel olarak geliştirilmiş bir karar modeli olan TypeSafe'in Jev'i ile karar doğruluğu ve hız açısından eşdeğer olduğunu bildiriyor. Yazı ayrıca Jev'in başaramadığı görüntüler üzerinde tipli kararlar alma yeteneğini de ekliyor.

Kararlar için prompt kullanmanın sorunu

Yazılımların bir LLM'den istediği şeylerin çoğu, aslında kılık değiştirmiş çoktan seçmeli bir sorudur: bu ticket hangi ekibe gidecek ya da bir sözleşme maddesi sorumluluk bölümüne mi ait. Standart çözüm, sabit bir değer kümesinden oluşan bir JSON yanıtı talep etmektir. Bu işe yarar; ama model bir bütün nesne üretmek zorundadır — bir reasoning modeli önce yüzlerce token boyunca düşünebilir — ve açıkça istemediğiniz sürece hiçbir güven sinyali sunmaz. Yazıya göre hız, maliyet ve güven değerinin eksikliği, genel amaçlı LLM'leri yüksek hacimli karar hatlarının dışında tutmuştur. Jev ve Convai'nin Laya'sı gibi özel "System One" modelleri tam da bu iş için vardır: durum ve adlandırılmış seçenekleri alır, her biri için bir güven değeriyle birlikte seçilmiş bir seçenek döndürürler.

Kararı logits üzerinden okumak

Teknik, LLM'lerin perde arkasında nasıl çalıştığından yararlanıyor: bir model asla doğrudan metin yazmaz; her adımda kelime dağarcığı üzerinde bir olasılık dağılımı yayar ve üretim bu süreci tekrarlar. İhtiyacınız olan tek çıktı bir indeksse, tek bir adım yeterlidir.

Prompt, durumu, soruyu ve numaralandırılmış seçenekleri JSON olarak içerir ve modelden choice_index: biçiminde bir indeksle yanıtlaması istenir. Assistant turn'ü önceden doldurulur, böylece prompt zaten choice_index: ile biter; bu da bir sonraki tokenı seçenek indekslerinden biri hâline getirir. Uygulama, modelin üreteceği tokenı okumak yerine, o tek konumda her seçenek indeksine atadığı olasılığı okur, kelime dağarcığını bu indekslerle sınırlar, yeniden normalize eder ve en olası olanı seçer. Sonuç, seçenekler üzerinde tam bir dağılımdır — belirsiz durumları bir insana yönlendirmek için bir güven ölçütü olarak da kullanılabilir — ve maliyeti tek bir forward pass'tir.

vLLM üzerinde çalışır hâle getirmek

Yazıya göre uygulama, /chat/completions endpoint'ini continue_final_message ve add_generation_prompt: false ile kullanıyor; böylece model yeni bir turn başlatmak yerine önceden doldurulmuş turn'ü sürdürüyor. Aynı çağrı metnin yanında görüntüleri de kabul ediyor ve görüntü tabanlı kararları mümkün kılan da bu. Üç vLLM detayı önemliydi:

  • allowed_token_ids, diğer tüm tokenları maskeleyerek çıktıyı geçerli seçenek indeksleriyle sınırlıyor; yazarlar bunu ayırmış ancak bir gereklilik değil bir koruma rayı olarak nitelendirmiş.
  • top_logprobs yetersiz çünkü dağılımı sınırlama öncesi raporluyor; baştaki boşluk gibi biçimlendirme tokenlarının en üst sıraları işgal etmesine ve bazı seçeneklerin listeden düşüp görünürde sıfır olmasına izin veriyor. vLLM'in logprob_token_ids'i ise tam olarak istenen token id'leri için log olasılıklarını döndürüyor.
  • İndeks token id'leri tokenizer'a bağlıdır ve rakamlar her zaman tek token değildir — GLM-5.3-Flash'ta "12" için tek bir token var. Model bazlı tokenizer'ları göndermek yerine kütüphane, serving endpoint'ten bir prompt'u echo etmesini istiyor ve tam tokenizasyonu yanıttan okuyor.

Python kütüphanesi ve benchmark altyapısı edgelesssys/privatemode-decisions ve edgelesssys/privatemode-decisions-benchmark olarak açık şekilde yayımlandı; yazarlar, yazıdaki her sayının benchmark'tan yeniden hesaplanabileceğini belirtiyor.

Benchmark kurulumu ve öne çıkan sonuçlar

Karşılaştırma, her biri 2 ila 151 seçenek içeren, İngilizce ve Almanca olarak intent yönlendirme, duygu analizi, konu sınıflandırma, moderasyon, entailment, soru cevaplama, hukuki metin ve taranmış belgeleri kapsayan 29 genel, etiketli veri kümesiyle yapıldı. Üç sistem aynı durumu, aynı sıradaki seçenek listelerini ve aynı talimatı aldı: bu teknikle Privatemode üzerinde GLM-5.3-Flash, Jev ve Laya. Jev ve Laya varsayılan ayarlarla çalıştı ve GLM prompt'u bu veri kümeleri üzerinde optimize edilmedi.

Her veri kümesi iki kez çalıştırıldı. Temperature 0'da bile GLM kurulumu ve Jev, birebir aynı çalıştırmalar arasında yanıtların %3,5'e kadarını değiştirdi; çünkü batching ve kayan nokta aritmetiği, yoğun bir sunucudaki bir forward pass'in bit düzeyinde yeniden üretilebilir olmasını engelliyor; daha küçük farklar gürültü kabul edildi. Bu sınırlar içinde yazı, doğruluk ve hızda Jev ile eşitlik bildiriyor; playground yanıtları tipik olarak birkaç yüz milisaniye içinde geri dönüyor. Model klasik hile sorularının çoğunu çözüyor, hepsini değil.

Neden önemli

Rafından alınmış bir model amaca özel eğitilmiş bir karar modeliyle eşitliğe ulaşıyorsa, LLM'leri yüksek hacimli karar sistemlerine sokma engeli büyük ölçüde ortadan kalkıyor: her karar, tam bir JSON üretimi yerine kabaca bir token'lık işlem gücüne mal oluyor ve yanıt bir olasılık dağılımıyla geliyor — tam da güven eşiği, çekilme (abstention) ve insan-döngüde yönlendirmenin ihtiyaç duyduğu şey bu. Görüntü desteği, altta yatan chat endpoint'inden bedavaya geliyor ve yaklaşım, token id'leri sunucudan keşfedildiği için ilke olarak modelden bağımsız. Uyarılar ise yazarların kendilerinin belirttikleri: özel bir benchmark, varsayılan ayarlarda rakipler ve çalıştırmalar arasında %3,5'e kadar varyans; bu yüzden küçük doğruluk farkları fazla yorumlanmamalı. Ve hiçbir şey eğitilerek dahil edilmediği için kalibrasyon kalitesi temel modelden miras alınıyor — bu olasılıklar üretim eşiklerini yönlendirmeden önce doğrulamaya değer.

  • #llm
  • #decision-models
  • #vllm
  • #inference
  • #benchmark
  • #glm

İlgili yazılar